ResARC:面向超低码率图像压缩的残差感知自回归编码
提出ResARC,显式补偿量化与生成残差,在超低码率下保持有竞争力感知相似度并显著提升分布保真度。
从残骸到智慧:从真实世界多视角照片中恢复碰撞力学
利用事故车多视角照片预测碰撞变形分类描述符与ΔV,为缺失结构化数据的碰撞力学估计提供参考。
从给定证据到收集证据:面向纵向医学推理的智能体学习
提出CASE临床智能体系统,构建纵向多模态基准,通过智能体学习赋能医学推理,性能超GPT-5.4。
OmniReasoning:突破音视频联合推理极限
提出音视频联合推理基准、数据引擎与模态分解自蒸馏法,在多项基准显著提升全模态模型表现。
面向驾驶行为视频描述的预训练模型适配比较研究
比较自动驾驶中LLM微调与提示方法;在BDD-X上,全量微调SpaceTimeGPT部分指标超基线,并分析LoRA与VideoLLaVA提示工程的局限。
PartiCam:基于奖励引导的相机控制视频生成
提出免训练粒子滤波的奖励引导框架,以全局-局部精炼实现精准稳定的相机控制视频生成。
从前到后:面向非对称跨视角车辆重识别的视觉语言模型基准测试
提出前到后车辆重识别基准,评测视觉语言模型;其未稳定超越检索基线,推理可提升,人类更可靠。
面向文本到图像模型后门防御的正常扩散动力学学习
提出NDDL,仅用良性样本学习扩散轨迹正常转移动力学,以预测偏差检测并定位后门,泛化性强。
镜头光晕去除与重建
提出光晕去除与重建:建大型数据集,微调扩散模型去大光晕;建模光晕并与3DGS联合分解,可编辑迁移。
RESUME:基于运动与残差信号循环状态更新的高效视频语言建模
RESUME以锚帧初始化隐状态,逐预测帧循环更新,向视频语言模型输出时序轨迹,时序推理显著提升。
EffGS:高效高保真高斯泼溅
EffGS通用加速框架融合频率感知引导、局部密度控制与自适应尺度调制,提升训练渲染效率并保持高保真重建。
小米-OCR-0 技术报告
小米-OCR-0:0.8B统一模型,兼顾文档解析与OCR理解,1.7亿语料加渐进训练,多项基准最佳。
CoVLM-Bench:面向协同驾驶问答与规划的真实世界基准
提出车路协同问答与规划真实世界基准CoVLM-Bench,含2196帧、35136条标注,并构建统一VLM基线,显示问答适配与理由监督降低规划误差。
HEIR:学习具有功能角色的人-实体交互
HEIR基准用完整角色集合评测人-实体交互,CoRISP方法在重复角色与共享参与者事件上领先。
HERO:面向肿瘤学的鲁棒表示组织学编码器
HERO病理基础模型基于5亿切片训练,对中心、扫描仪和染色差异鲁棒性最强,临床任务表现领先。
系统化多智能体视觉语言导航:形式化、基准与方法
首次形式化多智能体视觉语言导航为约束协调问题,提出MAVLN基准与TRISS系统。
CoDimRecon:面向仿真就绪三维场景的智能体重建,涵盖可变形曲线、曲面与体
提出智能体框架CoDimRecon,从多视角RGB重建含刚体、铰接与可变形曲线/曲面/体的仿真就绪场景,并经行为测试修正。
AerialDojo-200K:面向开放世界空中目标搜索的大规模基准套件
提出大规模基准AerialDojo-200K,含42个仿真场景与20.5万任务实例,推动开放世界空中目标搜索研究。
持久性强制:利用像素空间扩散中的特征特化
像素空间DiT异质细化形成持久/活跃特征,PerF借此引导生成,ImageNet上取得更低FID。
同一几何,不同结果:视觉语言模型中模态差距的读出依赖效应
统一几何解释模态差距:均值分离近似秩一;差距修改因任务而异,可改善、损害或恢复分类与检索性能。
面向高效医学图像增强与分割的硬件感知函数式Kolmogorov-Arnold网络
提出硬件感知两阶段压缩FunKANLite,参数量降至1/5.6、能耗降68%、吞吐增2.9倍,保持医学图像增强与分割精度。
探讨从图像数据中识别拓扑关系的学习模型
构建1.1万张标注图像数据集,对比传统与深度学习模型,VGG16准确率达89.55%,凸显迁移学习优势。
通过免训练自适应响应几何提升度量深度补全
提出免训练自适应响应几何,将深度/对数深度/视差坐标变为图像级未知,提升度量深度补全精度。
FD-AA:一种用于胸部CT中偶发腹部异常检测的轻量级焦点-弥散与衰减感知分类头
FD-AA轻量器官感知头结合衰减感知与掩码广义均值池化,在冻结3D CT编码器上提升偶发腹部异常检测性能。
PreviewDiff:多模态评判器引导的扩散隐空间搜索
无需训练,在去噪中途解码预览,由多模态评判器反馈分支搜索并重噪隐变量,让验证算力在生成过程中主动引导。
LeRF:面向视角采择推理学习参考坐标系
训练视觉语言模型构建显式参考坐标系,先监督微调再强化学习,提升视角采择推理。
面向神经编码与解码的稀疏视角可解释三维动物行为表征
SABLE以自监督几何先验从稀疏视角重建可解释的三维行为表征,零样本泛化,助力神经编码与解码。
从敏锐之眼到专家思维:在 MLLMs 中内化专家知识实现篡改文本检测
提出 EKI 两阶段框架,将专家取证知识内化到 MLLM,解决双重不匹配,在篡改文本检测上达 SOTA 且推理高效。
生成中的表示设计:扩散 Transformer 中的跨视图类令牌对齐
在扩散变换器中引入跨视图类令牌对齐,联合流匹配训练,提升表示质量且不损生成质量。
三思而后修:笔画引导注意力的风险感知满文手稿修复
提出SAGE-Restore选择性修复框架,先评估需修复区域,以笔画结构线索与像素软门控,兼顾退化恢复与完好内容保留。
面向统一多模态模型的演化数据相互对抗自训练
提出MATE,让生成与理解分支互相对抗自训练,挑战随模型演化,在Janus-Pro-1B上提升多项基准。
StructRL:面向长时程视觉-语言-动作任务的在线结构化强化学习
将长时程任务分解为可验证子任务,按完成进度给予结构化中间奖励,显著提升VLA长时程任务表现。
Merlin Plus:一个大规模、多癌种、图像-掩膜-报告数据集
首个含9器官肿瘤掩膜的大规模CT数据集,用报告驱动主动学习降低标注成本,支持癌症检测、分割与纵向分析。
高倍放大知识为何可迁移?全切片成像中的跨分辨率蒸馏研究
跨分辨率蒸馏中,重建误差不足以衡量迁移效果,学生预测能力与模型利用共同决定下游收益。
压缩以记忆:通过在线策略蒸馏学习紧凑记忆以实现长视频生成
提出PACC,用在线策略蒸馏训练压缩器,将历史帧压缩为紧凑记忆标记,不改生成器即增强长视频记忆与一致性。
OTT3R:以1%算力实现多视角三维重建与快速数据集生成
以1.6%算力蒸馏出1.02亿参数学生模型,3.5小时生成66.7万张图像伪标签,精度超COLMAP且快980倍。
LEGO-Anything:面向三维场景重建的编码智能体
编码智能体迭代编写并执行Blender代码重建三维场景,并引入评测基准与改进插件。
面向鲁棒室外激光雷达定位的时序感知融合
提出TempLoc时序感知框架,结合全局坐标估计与不确定性引导融合,提升室外LiDAR重定位鲁棒性。
隐蔽性是关系,而非属性:事件表示如何为基于事件感知中的时序攻击制造盲点
事件表示使隐蔽性成为观察者关系;Null重定时攻击利用时序盲区,保持受保护张量不变并获高成功率。
面向可扩展、上下文感知的组织学图像单细胞空间转录组预测
CELLO单次前向并行提取全细胞特征,距离衰减注意力融入局部上下文,跨12器官千万细胞,提速14倍。
RA-CFGCache:从分支级准则到无分类器引导下的引导风险控制
提出RA-CFGCache,在无分类器引导下融合分支误差与传播风险,在线控制缓存,改善效率与保真权衡。
DynamicHOI:面向物理感知手物交互重建的耦合动力学
提出物理感知重建框架DynamicHOI,耦合手物动力学并以驱动先验抑制力学不合理运动,提升重建性能。
在线通用增量学习:迈向任意时刻的类别与领域无关适应
提出Online VIL:类与域无边界在线共变;TopFlow以域无关流匹配与全局拓扑保持实现SOTA。
DARE:以双路径自回归感知编辑缓解幻觉
提出DARE混合编辑框架,融合文本、图像对比与自回归感知信号,减少LVLM物体幻觉且保持感知性能。
事件边界处的预见:评估视频世界模型中的物理预测
基于62段自由落体视频提出事件锚定评测,发现视频世界模型能触发后果却常延迟,时序合理不等于物理一致。
重新构想视频动态
RVD通过自监督重建,从视觉上下文中解耦出可编辑的动态令牌,实现语言引导的动态编辑与重渲染。
ThinkingGuard:通过逐步风险归因解码多模态大语言模型中的隐式危害
提出ThinkingGuard,逐步风险归因检测多模态大模型隐式危害,构建TriggerBench
面向连接组学突触检测与校对的视觉语言模型基准评测
视觉语言模型在连接组学突触检测与校对:零样本近随机,微调后开源模型追平专家,跨物种合并错误识别更优。
医学视觉语言模型为何未充分利用其视觉编码器:皮肤科视角
医学视觉语言模型未充分利用视觉编码器,皮肤科中编码器显著更强;描述后决策与编码器辅助重排可改善。
SCCM:面向ERP稠密特征对应的球面一致粗匹配
SCCM通过球面先验在粗匹配阶段校正ERP的拓扑、度量与面积三重畸变,显著提升稠密特征匹配精度。