基于时空分割的孟加拉国河岸侵蚀分析
用参数高效SAM模型从历史卫星图像分割河岸侵蚀,IoU 0.867,面积误差仅0.17%,可推广至新区域。
分而谈之,合而观之:语言目标检测的解耦与层次化表示学习
提出TaSe框架,将文本解耦为对象、属性、关系并层次聚合,用于语言目标检测,性能提升24%。
绘画风格的持久性
用持续同调分析绘画,可客观区分艺术家及流派,并能鉴别AI仿作。
激活边界匹配:低秩适配的任务感知初始化
提出ABM-LoRA,用早期探针的激活边界符号初始化LoRA,提升下游性能且开销低。
医学影像AI竞赛缺乏公平性
系统研究249个医学影像挑战赛发现,数据集地理、模态及问题类型代表性不足,且访问受限、许可不规范,影响可重复性和临床价值。
iOSPointMapper:基于移动AI的实时行人无障碍地图绘制
iOSPointMapper利用iPhone/iPad实时测绘人行道,通过AI识别设施、用户验证并匿名上传,助力无障碍数据建设。
超越像素:基于模式驱动的智能体推理实现视觉隐喻迁移
提出视觉隐喻迁移任务,用模式驱动多智能体框架实现跨域逻辑迁移,显著优于现有方法。
Relax Forcing:面向一致长视频生成的松弛KV记忆
提出无需训练的松弛强制机制,将时序记忆分为锚定、尾部与历史帧,减少误差累积并提升长视频生成质量。
当城市教会汽车:来自基础设施的无标签3D感知
利用路侧单元作为无监督教师,为自动驾驶提供无标签3D感知训练,显著降低标注成本,具有可扩展性。
基于描述符的Beta证据实现相机无关的3D高斯溅射剪枝
提出相机无关的3D高斯溅射剪枝方法,用描述符与Beta证据模型评估可靠性,无需相机参数,高效剪枝且保持质量。
自动驾驶中,推理模型尚未遵循其推理:KITScenes LongTail 数据集
推理模型在罕见驾驶场景中常未按自身推理行动;二者冲突时推理通常正确,据此执行可提升运动规划。
基于3D MRI的多模态3D CNN阿尔茨海默病分类与防泄漏受试者级评估
多模态三维CNN融合T1与组织概率图,受试者级验证准确率72.34%、AUC 0.778,聚焦内侧颞叶与脑室。
基于双重自一致性强化学习的科学图形程序合成
提出闭环框架,含高质量数据集与基准,用双重自一致性强化学习提升图形程序合成,模型达最优。
DeferredSeg:医学图像分割的多专家延迟决策框架
提出延迟分割框架,通过学习委派决策实现人机协作,支持多专家路由与负载均衡,提升医学图像分割可靠性。
多模态AI中多中心专家混合用于去偏放疗靶区勾画
提出多中心专家混合框架,无需数据共享即融合多样临床策略,在多模态放疗靶区勾画中超越基线,支持本地定制,提升泛化性。
基于模拟器的框架:从三维舌网格构建可验证的肌肉锚定问答(扩展版)
构建基于模拟器的三维舌问答,从三维舌网格生成可验证的肌肉问答记录,验证了几何监督的有效性。
位级三角内容感知置换的脆弱图像水印:零误报率、单比特敏感性与任意维度支持
提出位级三角内容感知置换的脆弱水印,实现零误报、单比特敏感及任意尺寸,抗多种攻击。
学生口头报告多模态数据集(含传感器与评估数据)
含12小时、50场学生口头报告的多模态数据集,整合音视频、眼动、生理及交互数据,支持自动反馈与多模态学习分析。
Doc-CoB:利用视觉链式框选推理增强文档理解
提出Doc-CoB框架,由粗到细聚焦关键布局区域,兼顾全局信息,显著提升文档理解性能。
HyperVision:通道自适应的地基高光谱视觉预训练骨干网络
首个地基高光谱预训练骨干,通道自适应与无监督学习,多数据集大规模预训练,大幅提升分割、跟踪、检测性能。
别让视频说话:面向音视频语言模型的音频对比偏好优化
提出音频对比偏好优化,采用输出与输入对比双目标,抑制视频驱动的音频幻觉,增强音频证据利用。
GraSP-VL:长度作为视觉-语言表征的语义粒度接口
提出GraSP-VL,用近正交前缀变换将冻结VLM嵌入重构为可截断的语义粒度接口,兼顾细粒度与稳定性。
RecoverFly:面向空中视觉语言导航的失败感知强化学习后训练框架
提出失败感知强化学习后训练框架,提升无人机视觉语言导航成功率,在TravelUAV基准上提升3.12-8.37个百分点。
面向具身控制的动作与语言条件视频评估
提出动作-语言条件视频评估法,低误报,为具身策略优化提供有效反馈。
子空间对齐用于视觉-语言模型测试时自适应
针对分布偏移下模态间隙与视觉噪声问题,提出SubTTA,对齐双模态语义子空间,过滤噪声,提升测试时自适应性能。
UFO-DETR:面向无人机微小目标的频率引导端到端检测器
提出UFO-DETR,通过频率引导和多尺度建模提升无人机微小目标检测,性能与效率优于RT-DETR-L。
Think3D:用空间思维实现空间推理
提出Think3D框架,让VLM通过3D工具主动探索空间;Think3D-RL仅用最终奖励使小模型自主学会3D操作,显著提升空间推理能力。
CounterVid:缓解视频语言模型中动作与时间幻觉的反事实视频生成
提出反事实视频生成框架,构造约2.6万偏好对,结合偏好优化,缓解动作与时间幻觉,提升基准性能。
OS-Marathon:面向超长周期重复性任务的计算机操作智能体基准测试
提出OS-Marathon基准,评估超长周期重复性任务,现有智能体表现差,引入人类演示的个性化策略可提升性能。
SIMPLER:基于相似性引导的层剪枝实现地球观测基础模型高效适配
提出SIMPLER,用相似性自动剪枝冗余层,无需梯度,剪79%参数保94%性能,训练提速2.1倍、推理2.6倍。
基于抗篡改多功能水印的高保真人脸内容恢复
提出VeriFi多功能水印框架,实现高保真人脸恢复、像素级定位与版权保护,鲁棒性强。
超大型视频推理套件
提出VBVR:含200个推理任务、超百万视频片段,规模大三个数量级;配套可验证基准,发现涌现泛化。
高斯抓取:动态手物交互的快速单目重建
提出新方法,以紧凑高斯和表示,从单目视频快速重建动态手物交互,提速4.4-38.9倍且保持时间一致。
RefracGS:基于3D高斯光线追踪的折射水面新视角合成
解耦水面与场景,神经高度场与高斯场建模,斯涅尔光线追踪联合优化,高质量新视角合成,训练快15倍,实时200FPS。
NEvo:神经引导的进化视频合成,用于动态视觉选择性
提出神经引导进化视频合成框架,生成针对脑区的动态刺激,超出人工视频,揭示视觉通路动态选择性差异。
多模态智能体真的受益于工具使用吗?能力增益的系统性研究
多模态智能体工具调用带来的能力增益有限,多数问题不用工具也能解决,需区分工具可用性与实际能力。
PercepCap:结构化时空感知的视频描述模型
PercepCap:先显式生成时空感知轨迹,再生成描述,两阶段训练优化质量。
利用自监督物理引导深度学习从常规MRI进行定量映射:在大规模临床异质数据集上的应用
自监督物理引导深度学习用常规磁共振生成定量参数图,经数千例临床异质数据验证稳定可重复,助力大规模定量研究。
CultureVidBench:文本生成视频中的文化理解基准测试
提出文化视频基准,含千条提示覆盖多国文化,评估发现现有模型虽语义视觉佳,但细粒度文化细节渲染不足。
视频世界模型的潜在空间记忆
提出视频世界模型潜空间记忆,扩散潜空间建3D缓存,免像素重建,提速10.57倍、降内存55倍,最优。
Loop-Mamba:退化感知与共享记忆的循环Mamba老照片修复框架
提出循环状态空间框架Loop-Mamba,将老照片修复视为渐进状态演化,引入语义引导退化估计与共享结构记忆,轻量高效,优于现有方法。
残差流匹配与动态交叉交互的3D多人运动预测
提出先验引导残差流匹配框架,结合动态交叉交互与解耦关节运动架构,提升3D多人运动预测精度,达到最优。
ET-Prune:面向文本密集型多模态大语言模型的证据感知动态预算视觉令牌剪枝
ET-Prune:证据感知动态预算剪枝,文本密集任务中保留一半视觉令牌即领先或持平基线。
X²Localizer:面向渐进式跨视角视频地理定位的跨粒度对齐
提出PCVG与跨粒度对齐法,结合滑动窗口重定位,提升早期定位,单帧Recall@1+4.7。
BehaviorWorldGen:利用可控行为感知的结构化世界生成,打通行动模型与世界模拟器的闭环
提出行为感知结构化世界生成框架,实现可控多智能体交互,提升困难场景的动作模型性能。
PPE-Bench:针对公私信息纠缠的MLLM遗忘评估基准
提出PPE-Bench,评估公私信息纠缠下的MLLM遗忘,发现现有方法减隐私泄露却损公共信息。
面向运动生成、编辑与结构内重定向的统一条件流
提出统一条件流模型,将运动生成、编辑与结构内重定向统一为条件调制传输,零样本实现,无需任务微调。
棋盘格:干净标签后门攻击的闭式数据无关触发器设计
提出棋盘格触发器,无需数据与训练的闭式设计,低投毒率下SOTA且抗防御。
统一预测与规划:冲突感知分离参数训练
提出冲突感知分离参数训练(DPT),分离任务参数以缓解技能冲突,实现拥挤环境下高效、安全的统一预测与规划。
仿真预训练灵巧操作
仿真VR采集灵巧手数据预训练,微调后优于从零训练,验证仿真遥操作可支撑真实灵巧操作。