SGA-Flow-GRPO:面向Flow-GRPO的空间梯度引导信用分配
提出空间梯度引导的信用分配框架,用奖励梯度构建连续空间信用图,辅以MAD鲁棒归一化,在GenEval上达SOTA对齐质量。
RefCompose:基于LoRA条件扩散的多参考图像生成
RefCompose用固定参考画布与双流LoRA解耦布局和外观,实现恒定显存的多参考图像生成。
更少词元,更多自教:面向极端视觉词元削减的在线策略自蒸馏
提出LT-OPD:全词元教师对学生自生成轨迹做在线自蒸馏,配预算课程,5%词元下性能升至82.3%。
EyeVQA:从识别到空间定位的眼科视觉语言模型基准评测
EyeVQA整合21个眼科数据集,含2万问答、六病七题型,44.5%需跨图推理;14个VLM最佳仅62.8分。
Endo-TSR:面向内窥镜重建的外观与运动时域谱建模
提出Endo-TSR,用有界傅里叶颜色残差和平移残差建模时序外观与运动,配Matérn谱先验,内窥镜重建质量最优。
基于凸包自适应偏移的骨架动作识别去偏
提出凸包自适应偏移归一化CHASE,减轻骨架实体偏置,提升动作与交互识别性能。
面向密集事件视觉的脉冲神经网络片上训练
提出DELL局部学习,面向密集事件视觉,降低脉冲网络训练内存并提升光流与分割性能。
StegGNN:面向图像隐写术的图表示学习
提出基于图神经网络的自编码器图像隐写框架StegGNN,将图像建模为图结构,性能与CNN基准相当。
CityToolVQA:面向城市低空环境三维空间认知的工具增强视觉问答
几何工具链处理定量问答,零样本适配VLM;准确率67.6%,十个模型提升12.7–36.9个百分点。
RefAdapt-DiT:面向参考条件扩散 Transformer 的自适应联合注意力
免训练RefAdapt自适应控制参考-目标联合注意力,超少步生成最高加速3.54倍且画质相当。
一种端到端潜空间展开方法:无需 Fréchet 损失,将少步 ImageNet 256×256 生成推进至 FID 1.11
提出先蒸馏后精炼的潜空间端到端 FiST,实现少步 ImageNet-256 生成 FID 1.11,无需 Fréchet 损失。
ProCAP:面向视觉语言模型的概率交叉注意力提示学习
ProCAP用双向交叉注意力联动视觉与文本提示,高斯参数化加KL/L2正则,配对称InfoNCE对齐,冻结CLIP提升少样本泛化与迁移。
MVAgent:通过一致性条件构建与镜头级策略优化实现多智能体视频生成
MVAgent将多镜头视频生成转为条件构建,多智能体协作并优化镜头级策略,提升跨镜头一致性与叙事质量。
AlphaEarth 能区分城市,但压缩了城市变异
审计显示AlphaEarth能区分城市、支持跨区域比较,却压缩城市变异,年度层差异未经验证。
LiTe-GS:面向3D高斯泼溅的预言机高效下一最佳视角选择
LiTe-GS随机子集评估候选视角,减少信息预言机调用,高效选择下一最佳视角并保持重建质量。
什么能提升多模态虚假信息检测?来自大规模实证研究的答案
基于3375余次实验,系统比较预训练视觉语言模型的多模态检测设计选择,提炼指南并回答四个关键问题。
CSCWD:面向边缘设备轻量级微小目标检测的跨尺度通道级知识蒸馏
提出CSCWD跨尺度通道蒸馏,将教师P2监督迁移至学生P3,提升边缘轻量模型微小目标检测且不增推理开销。
LensDesigner:一种面向光学镜头设计的自我改进智能体
LensDesigner自主智能体,融合镜头库检索与课程自进化,在LensArena基准上显著超越基线。
图谱早已内含:从预训练扩散模型中恢复群体模板
无需重训,扩散模型单次推理即可提取内在图谱,跨域适用并能推及亚群。
事件的形状:通过跨域蒸馏获得的基于边缘的归纳偏置
事件域向RGB域蒸馏,带来颜色不变性、形状偏置与高频噪声鲁棒性,机制为弱化纹理、强化边缘形状依赖。
动作强制:通过恢复底层自运动基在无监督视频上训练世界模型
无需动作标注,用像素位移PCA恢复自运动基,为无监督视频生成可控世界模型训练信号,并评估。
StarWM:面向鲁棒世界模型的自监督训练注意力路由
StarWM自监督训练注意力路由决定重建区域,双流解码器隔离目标,动态干扰下性能最优并高保真保留状态
MedTokenBudget:面向皮肤镜图像分类的病灶保留Token路由
提出MedTokenBudget有监督Token路由,用病灶掩码与LATS选Top-K,提升皮肤镜分类病灶保留率。
面向视觉表征学习的条件预测充分统计量
提出条件预测充分统计量CPSS:用余弦损失预测下一图块嵌入,保留共享因子并丢弃噪声;实验揭示几何特性。
EviDETR:为时刻检索与高光检测保留查询相关的时间证据
EviDETR以特征重加权、Top-2专家解码与跨任务融合保留查询相关证据,提升时刻检索与高光检测性能。
面向超高分辨率科学图像理解的结构引导掩码自编码器
提出SGMA,用四叉树分词与结构引导掩码处理千兆像素科学图像,多数据集超越MAE,推理提速24.8倍。
SAGE:基于频率均衡的源锚定引导,实现分层 RGB-T 对齐与融合
提出SAGE统一框架,融合频率均衡、分层对齐与子带融合,提升弱配准RGB-T对齐与融合性能。
结合通用与领域特定前置任务的脑部磁共振图像分割
多任务自监督预训练联合通用图像修复和领域特定脑龄预测,提升多发性硬化、缺血性卒中及皮层分割表现。
MM-VeriAgent:借助强化学习学会使用大量工具验证多模态虚假信息
面向混合来源多模态虚假信息,提出MM-VeriAgent,构建专用工具集,以强化学习训练代理调用工具,并用执行缓存提升效率。
TrafficImag:面向反事实路侧交通视频生成的基准
首个反事实路侧交通视频生成基准TrafficImag,按四维有效性评估,最佳模型端到端成功率55%。
VLALight:面向应急感知交通信号控制的轻量级视觉-语言-动作模型
VLALight轻量端到端视觉-语言-动作模型,直接由路口观测与相位预测动作,应急等待降21.1%。
放大你所注视的:文本到图像生成中的目标显著性增强
提出目标显著性增强任务及GazeME框架,用可学习标记token直接提升生成图像中目标物体的视觉显著性。
从单目到双目:通过重投影与选择性修补加速双目高斯泼溅
主眼渲染重投影至副眼,缝隙插值,遮蔽区选择性重绘,复用alpha权重省去深度渲染,实现双目加速。
基于通用复原先验的偏振图像复原学习
提出双分支一体化偏振复原框架,基于归一化Stokes表示,借通用复原先验与专家混合,并建复合退化基准。
面向卷积自编码器的免训练瓶颈宽度规划
MS-SRD无需训练神经网络,即可按NMSE约束估算卷积自编码器瓶颈通道,预测误差低且多数精确。
MDSkin-Net:模式分析先验与空间对齐正则化驱动的多任务皮肤病变分析
MDSkin-Net融合模式分析先验与空间对齐正则,提升皮肤病变分割分类的跨队列泛化。
Timo:驯服多模态扩散Transformer实现人体运动生成
提出运动学感知多模态扩散Transformer框架Timo,用于人体运动生成,性能显著超越现有方法。
少说多"看":面向多模态大语言模型推理分割的潜在推理
LIRSeg以可学习潜在令牌替代显式思维链做推理分割,两阶段训练结合三项信息机制,兼顾精度与效率。
动作风格滑块:面向人体动作扩散的端点监督连续风格控制
提出运动风格滑块,以端点监督构造风格方向,用标量强度控制扩散生成,实现平滑单调的连续风格调节。
面向跨域小样本学习的查询条件化原型自适应:单查询推理、受控比较与失效模式
WIPT以联合查询-支持变换生成查询专属原型,实现单查询跨域小样本自适应;仅局部提升,收益不普遍,主要改变不确定决策。
LLPR:面向单幅图像雨滴去除的位置感知学习与物理重建
提出LLPR框架,融合位置感知学习与物理重建,去除单幅图像雨滴,并发布真实数据集,超越现有方法。
UltraG-Bench:评估大型视觉语言模型在超声像素级证据定位上的多任务基准
构建超声像素级证据定位多任务基准,含三类任务,评测14个模型揭示语义与定位差距,并提出改进智能体。
ManiVid:统一且可解释的篡改视频取证分析
ManiVid统一可解释视频篡改取证,构建38K数据集与ManiVidLens,检测、定位与解释领先。
CCRV-Bench:基于约束的视觉语言模型因果推理评估
提出约束驱动基准CCRV-Bench,四维评估视觉语言模型因果推理,发现约束敏感性因任务与模型而异,单一总分掩盖不同失败。
面向渐进式免COLMAP三维高斯泼溅的可靠性调控轨迹优化
可靠性调控轨迹优化框架,以自监督双向循环一致性抑制免COLMAP 3DGS渐进跟踪漂移,提升轨迹与渲染。
Spackle:用自适应高斯补全大视角单图新视角合成
Spackle三阶段残差学习缓解容量竞争:预测基础3DGS、定位差区域、学残差高斯,大视角NVS领先。
OneWorld:在世界模型中学习跨动作一致的物理规律
提出OneWorld框架,用共享潜在物理机制联合建模多动作未来,提升跨干预物理一致性。
MVVBench:面向视觉语言模型的4D推理基准评测
真实多摄像机多视角推理基准,题目单视角或单时刻均不可解,覆盖六类能力,暴露模型时序定位与跨视角身份缺陷。
DAPEVO:深度自适应块帧-事件视觉里程计
DAPEVO在共享块位置独立估计图像与事件对应并融合证据,RGB帧稀疏时仍稳健,精度显著优于现有方法
IDM-Net:一种用于低光照图像增强的轻量级光照解耦调制网络
IDM-Net用双编码器提取RGB外观与亮度光照先验,经光照引导调制实现亮度与色彩的平衡,轻量高效。