空域知识保留模型调优下的鲁棒时空视频定位
提出零空间调优(NST),利用零空间特性保留预训练知识,同时适应低质量视频,性能超越现有方法。
从3D感知到安全推理:面向实时矿井监测的图基框架
提出融合3D感知与图记忆的矿井监测框架,实现实时安全推理,覆盖率93%。
PersistGS:面向4D高斯泼溅中物体恒存性的可微物理
PersistGS通过可微刚体模拟与3DGS结合,在遮挡期间恢复物体恒存性,显著降低轨迹误差。
AvatarMix: Identity-Preserving Cross-Avatar Composition for Outfit Personalization
纹理驱动视觉学习中的低频捷径
纹理驱动学习存在低频捷径,修剪低频成分可提升分布内准确率8%,但高频破坏存在权衡。
3DGS中毒攻击中的可检测性表征:一个分阶段基准
本文提出Poison-3DGS基准,系统性揭示3DGS中毒攻击中分阶段检测性差异,发现后期阶段信号更优。
面向印刷电路板缺陷检测的结构引导混合掩码预训练与空间连续性正则化
提出两阶段框架:结构引导混合掩码预训练+空间连续性正则化,PCB缺陷检测达85.5% mAP0.5,优于强基线。
EvoMemNav:用于零样本具身导航的高效自演进细粒度记忆
提出EvoMemNav框架,构建视觉语义记忆图,通过粗到细策略与反射写回,提升零样本导航成功率与泛化能力。
TrAction: 基于稀疏轨迹的动作识别
提出稀疏轨迹变换器及掩码预训练,实现高效动作识别,与外观特征互补,显著提升精度。
混合模态双人脸-发型检索
提出混合模态双参考检索任务DFHR,构建基准DFHR-Bench,通过MFHC框架融合人脸与发型特征实现跨模态属性组合。
CR-Seg:注意力引导与思维链增强的由粗到精推理分割
提出CR-Seg框架,通过注意力图粗定位和全局到局部思维链,实现由粗到精的推理分割,有效解决跨模态对齐与响应不一致。
关注一切:统一人类注意力建模的基础模型
提出统一多模态注意力建模的基础模型AAM,采用层次化语言提示与流体动力学方法,在16个基准上平均提升6%,视频推理加速4倍。
SkelHCC:基于双曲CLIP的缓存自适应骨架一次性动作识别框架
SkelHCC用双曲几何对齐骨架与语言,结合无训练LLM缓存,实现一次性动作识别SOTA。
通过宽基线匹配激发多模态大语言模型的复杂空间推理
现有MLLMs在宽基线匹配上F1仅37.2(人类84.0),作者提出ReasonMatch-Bench和DCRL方法,显著提升性能。
基于Transformer的高效局部块采样用于多发性硬化症脉络丛分割
开发SwinUNETR结合局部块采样分割脉络丛,精度0.868,计算量降低99%,优于现有模型。
3D目标检测中的学习型非极大值抑制
提出两种学习型过滤模块替代传统NMS,通过检测间关系提升3D检测精度,尤其改善小目标性能,计算开销小。
注意力塌陷之时:从结构到语义的阶段式视觉Token剪枝
提出STS两阶段剪枝框架,先最大化结构多样性,再过滤无关令牌,解决注意力塌陷导致的特征冗余。
UnsOcc:基于渲染融合的非结构化场景三维语义占用预测
提出UnsOcc框架,通过渲染融合与GS细化,显著提升非结构化场景三维语义占用预测性能。
在正确空间中扩散:潜在可扩散性的系统性研究
系统性研究潜在可扩散性,发现速度不可约方差是生成质量的稳定预测指标。
世界模型与语言模型的相遇:论具体推理与抽象推理的互补性
提出PF-OPSD方法,结合具体与抽象推理,在视觉预测基准上提升10.6%和10.9%。
TurtleAI:海龟图形学中多模态模型可视化编程基准测试
介绍TurtleAI基准,评估多模态模型在海龟图形可视化编程,发现成功率低,微调提升约20%。
Qwen-Image-Flash:超越目标设计
本工作从训练方案角度探索少步蒸馏,发现数据、教师指导和任务混合的关键作用,提出Qwen-Image-Flash,证明有效蒸馏需兼顾目标设计与训练组织。
超越单一解:面向图像压缩感知的多假设协作深度展开网络
提出多假设协作深度展开网络,联合优化多个解空间,动态步长与协作近端映射,性能优于现有CS网络。
半监督多模态人群计数基准
构建首个半监督多模态人群计数基准,制定标准化协议与基线,评估性能。
VidMsg:短视频中隐含消息推理的基准
VidMsg评估短视频隐含消息理解,含400片段9主题52消息;强模型常失败,提出基线VidVec-Msg。
图正则化非负简化四元数矩阵分解用于彩色图像识别
提出图正则化非负简化四元数矩阵分解模型,利用图拉普拉斯保持局部结构,提升彩色图像识别性能。
多模态大语言模型对抗鲁棒性研究
研究发现大规模多模态对抗预训练是关键,端到端训练显著提升鲁棒性,轻量测试时变换可作黑盒防御,并减少毒性输出。
文本到图像模型对文本编码器的需求比想象的要少
研究发现文本到图像模型仅需单词含义与词序即可生成高质量图像,无需全文本上下文信息。
基于Mag1c-SAS和LinkNet的星载快速甲烷检测流水线
提出Mag1c-SAS算法,比原方法快80倍,结合LinkNet降噪,在EMIT-MSeg数据集上AUPRC提升超30个百分点。
超越虚假稳定性:面向视觉-语言模型测试时对抗防御的高噪声漂移门控
提出高噪声漂移门控机制,仅在检测到对抗不稳定性时触发防御,有效改善干净-鲁棒权衡。
相机rPPG脉搏形态恢复中的模板塌缩与信息论极限
消费级相机无法编码个体动脉形态,跨被试Pearson r是波形重建中必要的塌缩诊断指标。
统一视频-动作联合去噪用于灵巧操作与数据生成
提出Donk统一视频-动作去噪模型,联合生成未来视频与双手轨迹,提升灵巧动作精度并作为数据引擎。
AmbientEye:自然环境下红外光照的瞳孔分割数据集
提出AmbientEye数据集,含260万张户外自然光照瞳孔图像,测试显示分割性能从0.928降至0.767,为环境光照眼动追踪提供首个基准。
TeX-1500:用于温度-发射率-纹理分解的配对真实世界长波红外高光谱数据集与基准
提出含1522对真实场景的长波红外高光谱与温度-发射率-纹理配对数据集,为数据驱动热感知提供监督基准。
基于傅里叶运动建模的条件潜在扩散模型用于虚拟群体合成
提出4D F-MeshLDM,用傅里叶运动建模的扩散模型生成高保真心脏网格序列,误差近零且保留临床指标。
低资源视频任务适应中时间上下文的(不)必要之处
系统研究视频理解中参数高效微调与探测,揭示时间上下文在骨干、PEFT和探测间的分配对低资源适应至关重要。
无需训练的多概念LoRA组合:基于提示感知的加权方法
提出无需训练的多LoRA组合方法,利用提示感知加权分配触发词重要性,提升多概念定制中的视觉质量与身份保持。
SLU-2K:基于问题的手语翻译语义评估基准
提出SLU-2K基准,通过问答评估手语语义理解,发现MLLMs接近随机,SOTA系统仅56.7%-75.2%,揭示现有指标高估理解。
Ultralytics YOLO26:统一的实时端到端视觉模型
YOLO26实现无NMS端到端推理,轻量化头设计,COCO达40.9-57.5 mAP,1.7-11.8ms延时,支持多任务。
超越压缩:量化视觉表征中的频谱可访问性
通过RSL量化频谱可访问性,发现深度上非单调峰值,CLIP投影中性,DINOv2池化导致频谱结构损失。
SparseStreet:面向实时街景模拟的稀疏高斯泼溅
提出SparseStreet压缩框架,实现80%压缩率,质量损失小,支持高效动态街景重建。
DyaPlex:面向双人交互的全双工语音-动作模型
提出流式全双工语音-动作模型DyaPlex,用双塔Transformer和统一令牌交织实现双人同步多模态交互,在4000小时数据上达成SOTA。
Seg2Track++: 面向多目标跟踪与分割的概率轨迹验证与数据关联
Seg2Track++融合SAM2与轨迹管理,通过MCD/CCM关联及伯努利滤波验证,实现零样本MOTS,提升身份保持并抑制假阳性。
CoralBay:一种自监督CT基础模型
CoralBay利用3D Swin与自蒸馏学习CT空间表征,高效迁移至多种放射学任务。
超越编码器堆叠:度量多编码器视觉语言模型中的编码器角色
重训练31个编码器子集发现,编码器贡献可分解为容量与必要性,高容量锚点配合自适应互补最优,预投影器秩解释残差变化。
MLP泼溅:以对象为中心的神经场
提出MLP-Splatting,用紧凑MLP基元分解场景,实现物体级交互编辑,内存降低1/15,渲染加速3倍。
采用高精度X光-CT配准的股骨截骨电磁导航
通过双X光片配准实现无透视电磁导航,截骨角度误差(3.05°)显著优于徒手(6.32°),精度媲美PSI。
基于注意力的扩散加权成像去噪模型
提出结合Swin Transformer注意力和多维门控细化的去噪框架,通过噪声水平调节,有效抑制异方差噪声,PSNR达33.69dB。
OVO-S-Bench:多模态大语言模型流式空间智能的分层基准
OVO-S-Bench是流式空间智能分层基准,揭示多模态LLM在异中心映射上的严重瓶颈,最优模型比人类低27分。
形式化绑定问题
用信息论形式化绑定问题,提出探测方法衡量ViT中的绑定信息,证明绑定是视觉识别和推理的关键。