基于RCDM/WaveMix的MRI超分辨率与任务感知分割
提出物理引导的无配对1.5T脑MRI轻量增强流程,其增益因分割模型与标签可靠性而异。
TSMD:面向鲁棒视频高光检测的时序-流模态丢弃
提出TSMD,模拟时序与整段模态缺失,联合MSE、相关性与峰值排序损失,提升视频高光检测鲁棒性。
BadAction:基于动作引导触发器的交互式视频生成后门攻击
首次系统研究交互式视频生成后门攻击,提出动作引导触发器,触发后冻结帧、无视后续动作,成功率91%。
UGOD:不确定性引导的透明度与丢弃机制用于稀疏视角3D高斯泼溅
UGOD为每个高斯估计视角相关不确定性,据此调控透明度并施加软丢弃,抑制过拟合,提升稀疏视角新视图合成。
面向可解释图像伪造检测的智能体工具增强推理
提出ATAR,用22种工具多轮推理,检测定位并解释图像伪造,零样本F1达78.5%,超MLLM基线11.8点。
DeCoPrune:基于去噪一致性的自回归视频扩散高效 KV 缓存剪枝
DeCoPrune免训练,用去噪一致性剪枝KV缓存,保留高差异token,降低自回归视频扩散推理成本。
CamAgent:面向多物种相机陷阱工作流的LLM智能体框架
CamAgent是LLM智能体框架,统一整合红外相机多物种分析工作流,以自然语言驱动物种识别、占据建模等工具,降低编程门槛。
超越局部线性:学习型图像编码器的尺度分辨几何
提出尺度分辨统计量,发现编码器特征位移非线性偏离局部预测,形成训练后才出现的凸起,反映学习对表征的塑造。
更好的教师监督就足够了吗?解锁多模态同策略蒸馏中的学生端学习
指出学生感知是多模态在线策略蒸馏瓶颈,提出S-OPD,借教师校准对比与策略一致性强化学生感知,即插即用。
GRC-Pose:面向无先验6D物体位姿跟踪的生成-重建对应
提出GRC-Pose,将无先验6D位姿跟踪建模为生成-重建对应,HOT3D最优,运动保持+58%。
Asking the World: Generalist Physical Reasoning through Agentic World Modeling and Probing
How to Reduce Localization Ambiguity? Geometry-Semantic Constrained BEV Representation Learning for Satellite-Ground Localization
MEND:世界模型中潜在幻觉的无标签检测、定位与校正
MEND用单一得分网络在推理时无标签检测、定位并校正世界模型潜在幻觉。
大型视觉语言模型中压缩触发隐蔽失效的特征感知令牌攻击
提出FATA,利用视觉编码器梯度,在保持全令牌正确时触发压缩后隐蔽失效,且检测率最低。
GeoGAT:双向时序采样结合层次化图注意力实现全球视频地理定位
提出GeoGAT,融合双向时序采样与层次图注意力,消除层级预测冲突,显著提升全球视频地理定位精度。
MindWorldBench:评估图像到视频生成中的心理状态到行为推理
提出MindWorldBench基准,评估图生视频的心理状态到行为推理,发现模型存在"全知偏差",视觉生成与认知推理脱节。
使用机器学习与人类相似性判断的感知色差建模
基于人类相似性评分建模色差,颜色表示比算法更关键,LightGBM结合感知类别特征最佳。
文本何时能取代视觉?图表推理中的结构性瓶颈
诊断区分信息缺失与未利用:黄金结构达87%,视觉与学习文本不足30%;答案相关拓扑比全局结构更关键。
面向少步视频生成的不确定性感知一致性蒸馏
提出不确定性感知一致性蒸馏,按局部时空不确定性重加权监督,结合对抗训练与语义对齐,实现4步视频生成。
OP-CAD:面向鲁棒音视频推理的在线策略干净音频蒸馏
OP-CAD以课程式特权自蒸馏,按声学敏感度加权干净教师监督,提升噪声下音视频推理鲁棒性且不损干净准确率。
TripleFlow:通过桥接残差编辑与原生生成实现免训练视频物体移除
免训练框架,耦合残差与合成流,将生成背景持续回注编辑轨迹,实现时空一致的视频物体移除。
Uruqi:从视觉经验中学习空间认知
Uruqi借合成相机轨迹密集监督,让视觉语言模型在连续视觉经验中学会自我运动追踪,空间认知显著提升。
基于检测Transformer的多壳扩散MRI纤维分辨微结构定量
用DETR从多壳扩散MRI联合预测MD、FA、主纤维方向与信号分数,支持可变隔室,合成数据精度高。
重新思考极低码率下的生成式图像压缩
极低码率生成式图像压缩会语义崩溃;RAE-CoD在表示自编码器空间对齐表示,16比特仍可识别且性能领先。
面向可提示概念分割的通用跨提示对抗攻击
提出通用跨提示对抗攻击AdvPCS,通过提示优化与感知欺骗,使概念分割mIoU降至5%以下。
让思维与答案对齐:以概率奖励驯服思维漂移
视觉意图定位中IoU强化学习存在思维漂移,Rita用思考奖励、一致性奖励和难度感知过滤提升对齐。
通过自蒸馏涌现的多视图几何
Poincar3以多视图自蒸馏替代RGB重建,无需显式3D监督,在对应估计、相机位姿与3D重建上超越现有方法。
PLRS-IC:胸部X射线视觉-语言对齐的双校准框架
PLRS-IC双校准框架:投影条件低秩残差适配局部对齐,信息量校准抑制假阴性,提升胸片零样本任务表现。
DC-SAE:加速扩散收敛的深度压缩语义自编码器
提出DC-SAE,解耦语义与像素编码,兼顾32×高压缩、高保真,并加速扩散收敛。
MegaAvatar:可控说话虚拟人生成
引入SMPL-X三维引导与音脸交叉注意力,实现身体、头动、表情可控且身份保持的说话虚拟人生成。
BMASH:球体运动感知的足球头球检测
BMASH融合Video Swin与足球运动特征,提升头球检测,并在全视频连续定位中表现有竞争力。
COBICount:无需在目标数据上训练,分离目标与背景响应的遥感目标计数
COBICount分离目标与背景响应,无需目标数据即可跨域遥感计数,MAE最低174.132。
TexTailor:基于自适应服装条件调控的纹理保持视频虚拟试穿
TexTailor借视频扩散Transformer,以时间步自适应调制、帧对齐位置编码和多源注入,提升高分辨率虚拟试穿的纹理保持与时空一致性。
EgoTools:迈向真实世界第一人称视频中的工具中心推理
首个第一人称工具使用理解套件,含100小时数据与千题基准,暴露模型工具推理短板,亦能提升训练效果。
迈向可信赖的胶质瘤诊断AI:不确定性量化的任务感知评估
评估胶质瘤MRI多任务诊断的不确定性量化:校准依赖丢弃率,不确定性助错误检测,无方法一致占优。
重新思考多图像理解中的多图像再表征
提出视觉框架Mosaic,揭示多图像再表征收益依任务而异,智能体仅凭准确率奖励即学会自主组合操作。
CAST:面向扩散模型的因果优势结构化训练与空间锚定组合奖励
CAST按模型去噪轨迹定SDE窗口,以因果场景图分解原子奖励并映射至像素空间加权,提升扩散模型组合生成能力。
PCB-MC:印刷电路板缺失元件分析
发布PCB-MC数据集,用于PCB缺失元件检测,含197种板型;基准显示现有方法在新板型上仍难奏效。
DensePed-Lite:面向遮挡下密集行人的质量感知自适应检测
提出DensePed-Lite,以质量感知自适应为原则,通过三项协同机制,在低复杂度下实现遮挡密集行人检测的精度效率更优平衡。
InfoAgent:基于证据的信息图可追溯生成与修复
InfoAgent免训练,以类型化依赖图绑定证据,分层生成并依赖感知局部修复信息图,提升准确率、缩小修复范围。
ResARC:面向超低码率图像压缩的残差感知自回归编码
提出ResARC,显式补偿量化与生成残差,在超低码率下保持有竞争力感知相似度并显著提升分布保真度。
从残骸到智慧:从真实世界多视角照片中恢复碰撞力学
利用事故车多视角照片预测碰撞变形分类描述符与ΔV,为缺失结构化数据的碰撞力学估计提供参考。
从给定证据到收集证据:面向纵向医学推理的智能体学习
提出CASE临床智能体系统,构建纵向多模态基准,通过智能体学习赋能医学推理,性能超GPT-5.4。
OmniReasoning:突破音视频联合推理极限
提出音视频联合推理基准、数据引擎与模态分解自蒸馏法,在多项基准显著提升全模态模型表现。
面向驾驶行为视频描述的预训练模型适配比较研究
比较自动驾驶中LLM微调与提示方法;在BDD-X上,全量微调SpaceTimeGPT部分指标超基线,并分析LoRA与VideoLLaVA提示工程的局限。
PartiCam:基于奖励引导的相机控制视频生成
提出免训练粒子滤波的奖励引导框架,以全局-局部精炼实现精准稳定的相机控制视频生成。
从前到后:面向非对称跨视角车辆重识别的视觉语言模型基准测试
提出前到后车辆重识别基准,评测视觉语言模型;其未稳定超越检索基线,推理可提升,人类更可靠。
面向文本到图像模型后门防御的正常扩散动力学学习
提出NDDL,仅用良性样本学习扩散轨迹正常转移动力学,以预测偏差检测并定位后门,泛化性强。
镜头光晕去除与重建
提出光晕去除与重建:建大型数据集,微调扩散模型去大光晕;建模光晕并与3DGS联合分解,可编辑迁移。
RESUME:基于运动与残差信号循环状态更新的高效视频语言建模
RESUME以锚帧初始化隐状态,逐预测帧循环更新,向视频语言模型输出时序轨迹,时序推理显著提升。