基于视频的斜视与白内障检测:面向无障碍的适应性Web界面渲染
提出实时视频检测斜视和白内障的系统,利用人脸网格与灰度分析,准确率分别达98.39%和96.90%,用于无障碍自适应界面。
最宽路径可达性场:保持连通性的细长结构分割
提出WPRF方法,通过可微最大最小可达性目标解决拓扑梯度饥饿,将梯度集中于瓶颈像素,提升细长结构分割连通性。
文本到图像上下文学习中的思维树推理
提出思维树推理框架,通过多分支推理选择最优假设,有效提升图像生成的一致性和语义对齐,无需额外训练。
命名分类器依赖的概念:语言锚定分解实现忠实解释
提出语言锚定分解(LAD),无需修改模型即可获得命名且忠实的概念解释。
注意力引导的跨时间聚类自监督视频目标分割
提出跨时间一致性与聚类框架,结合注意力引导token选择与轻量时间聚类,学习中层部件表征,实现无监督视频目标分割。
面向通用文档视觉问答的领域自适应VLM对比研究
评估8种VLM在三个文档域的DocVQA性能,发现视觉理解是瓶颈,少量目标样本即可快速适应。
EditVerse3D:基于区域感知学习的高质量3D物体编辑
提出EditVerse3D框架,以粗粒度引导实现高质量3D局部编辑,引入区域感知损失,效果优于现有方法。
为何伪造?揭示深度伪造检测器的语义词汇
后验可解释AI揭示深度伪造检测器隐式学习特征,实现空间定位与反事实分析。
DiffCVE:基于扩散的压缩视频增强
DiffCVE通过编码先验与压缩退化提示,提升严重压缩视频的感知质量。
基于原型锚定的广义流形回归用于未知域目标检测
提出MR-DCoT,将未知域目标检测视为流形回归,利用双链思考生成离流形样本并矫正,提升对未知域的鲁棒性。
放射学中的视觉基础模型:数据、方法、评估及临床转化范围综述
放射学视觉基础模型发展迅速,但评估不均、跨中心验证不足,临床转化受限于数据代表性与部署评估欠缺。
一种边缘感知提示增强的SAM用于超声图像分割
提出EP-SAM,通过边缘感知提示增强SAM,利用多块特征提取和边缘监督改善超声图像分割边界,性能优于现有方法。
Unraveling Machine Behavior by Multi-Level Bias Analysis and Detection: Methodology and Application to Computer Vision
SoccerNet 2026挑战赛结果
SoccerNet第六届年度挑战赛涵盖五大视觉任务,427支队伍提交1129份方案,总结各任务领先成果。
HAJJv2-CrowdCount:密集人群计数的零样本基准
HAJJv2-CrowdCount基准揭示:点基零样本计数在朝觐极端密集帧上MAE仅114.9,远优于检测/分割法(MAE>300)。
两阶段自适应对齐多模态融合的动作质量评估
提出两阶段自适应对齐多模态融合框架,解决动作质量评估中跨模态对齐与数据稀缺问题,在三个基准上实现显著提升。
中文标题:BUS:受脑启发的无监督自反思方法用于高级多模态推理
中文摘要:受脑启发提出无监督自反思框架BUS,无需标注数据即可增强视觉语言模型推理,在多项复杂任务中显著提升性能。
MMAgent-R²:面向智能体mRAG的重排序与拒绝学习
提出视觉重排序和主动拒绝机制,通过GRPO联合优化检索、验证与生成,在困难检索和多图多跳推理中取得最优性能。
当提示忽视结构:基于图的属性推理实现校准的视觉语言模型
提出ARGTCA,用图注意力网络建模属性依赖,显著降低期望校准误差。
用于PET引导的全身MRI翻译的异质性自适应扩散薛定谔桥
提出HA-DSB框架,利用VLM区域嵌入和PET双阶段引导,实现全身MRI高质量翻译,尤其改善病灶区域效果。
VCDP:用于半监督医学图像分割的变分条件分布代理学习
VCDP通过分布代理与变体原型对齐全局和局部特征,提升半监督3D分割对小器官和模糊边界的性能,且无额外推理成本。
InfraQR:边缘放置的类QR码结构化补丁攻击针对红外视觉-语言模型
InfraQR在图像边界放置类QR码结构化补丁,使红外视觉-语言模型分类准确率从98.67%骤降至0.70%,并黑盒攻击字幕与VQA任务。
自然图像对比学习的一种理论
对比学习最优表示由正弦波滤波器和部分白化实现,频率通过注水算法从功率谱计算。
参考和记忆引导的心脏MRI跨平面超分辨率
提出STRMSR框架,利用参考视图和记忆指导心脏MRI跨平面超分辨率,通过上下文匹配与动态特征聚合,实现4倍和8倍上采样提升。
基于Sentinel-1纹理与局部气候区的撒哈拉以南非洲贫民窟上下文感知制图
提出光学-SAR框架,结合Sentinel-2光谱与Sentinel-1纹理,非正规住区识别精度达0.816(干季)和0.807(湿季),跨季节稳定。
Face-trace:合成人脸生成器的开放集溯源与渐进式发现
提出开放集溯源方法,融合已知分类、能量拒绝与未知发现,WILD数据集上达96.73%准确率与87.74%聚类纯度。
无限世界与多样交互
LingBot-World 2.0升级:无限交互、实时高清渲染、多样动作,首创双代理(规划与合成),支持多人同时体验及轻量部署(14B/1.3B)。
Discovering Geometric Biases in 3D Face Reconstruction: A Curvature-Aware Spectral Framework for Fairness Evaluation
HIVE:理解视觉语言模型中的幻觉后推理
研究幻觉后推理阶段,发现幻觉描述提升视觉任务准确率,而纯文本任务影响有限,这对多模态推理可靠性至关重要。
学习统一可变形形状和纹理表示用于心脏视频分类
提出双向交叉注意力融合可变形形状与纹理特征,动态调整模态贡献,实现心脏视频分类最新性能并提升可解释性。
AA-ViT:具有结构和频率引导的解剖感知视觉Transformer用于对比增强脑MRI合成
提出解剖感知视觉Transformer,融合结构与频率信息,实现高质量对比增强MRI合成,经临床初步验证。
通过转移概率相关性的自动超声心动图分割实现稳定语义提取
提出STLSF模块与频率感知预训练,利用转移概率校正语义及纹理增强,实现高精度超声心动图分割。
面向机器人操作的视觉-语言-动作模型中的双潜记忆
LaMem-VLA将历史经验重构为潜记忆令牌并融入推理,以解决长期依赖任务,实验表现优异。
建筑工地动态物体检测与跟踪:鱼眼相机与激光雷达传感器融合模型
提出鱼眼相机与LiDAR融合框架,实现四足机器人实时动态物体检测跟踪,点云投影对齐图像检测,高精度鲁棒。
MedPMC: 一种为基座模型扩展高保真医学多模态数据的系统框架
MedPMC从PMC文献自动化筛选1100万高保真医学图文对,95.3%具医学相关性,显著提升多模态模型性能。
从数据完整性到数据充分性:在质量-时间-剂量权衡下的术中CBCT任务驱动成像框架
主张用数据充分性替代数据完整性,以临床决策需求为导向,在质量-时间-剂量间寻求平衡,接受近似误差。
EmbodiedGen V2: An Agentic, Simulation-Ready 3D World Engine for Embodied AI
面向准确快速的临床身体成分分析:一种面向多源CT的资源高效分层分割框架
提出粗到细分层框架,多源CT分割10组织,Dice达0.924-0.982,CPU上44.5秒/例,内存4.73GB,实现高效临床体成分分析
SonoRank: 迈向无需校准的实时前臂超声序列手指屈曲检测
SonoRank通过超声序列对相对运动排序预训练,实现无需校准的实时手指屈曲检测,F1提升28%。
面向具身智能的混合专家视频预训练扩展
提出LingBot-Video,基于MoE的具身智能视频预训练,优化架构、数据与训练,实现高效与物理合理性。
格式控制的多尺度JPEG压缩响应分析用于图像级伪造筛查
提出轻量级特征工程,用多尺度误差水平分析检测图像压缩历史不一致,格式控制下AUC达0.99。
G-PROBE:面向3D点云的跨视场地点识别与确定性耦合定位
G-PROBE提出免学习跨视场定位框架,通过虚拟传感器分解与确定性耦合,在不对称视场下实现高性能全局定位。
ROAD-Waymo:面向自动驾驶的大规模动作感知数据集
基于Waymo Open数据集扩展,含198k帧、12.4M标签,用于道路场景智能体、动作、位置和事件检测。
从我的视角到你的视角:利用特权自我中心监督从外部视角视频学习自我中心线索
提出Ego2ExoVLM,通过时间同步视频对和特权监督,使VLM从外部视频推断自我中心属性,提升ADL监测性能。
T^3S:基于热时间思维的卫星图像时间序列可泛化作物分类
提出T^3S方法,用热时间替代日历时间对齐物候,提升跨年跨区域作物分类的泛化性与不确定性校准。
中文标题:当蒸馏破坏运动控制:恢复快速视频生成器的生成轨迹
中文摘要:提出MotionEcho框架,通过自适应教师指导修复蒸馏模型的运动控制,提升保真度与视觉质量,保持生成效率。
VOTE:基于轨迹集成投票的视觉-语言-动作优化
提出VOTE框架,通过减少动作token和投票集成策略,实现高效推理与高性能,边缘平台推理达46Hz,成功率优于SOTA。
HunyuanVideo-HOMA:多模态驱动人体动画中的通用人-物交互
提出弱条件多模态框架HunyuanVideo-HOMA,通过稀疏运动引导和适配器,实现通用人-物交互视频生成,自然性与泛化性达SOTA。
Trexplorer Super:CT体积中管状物体的拓扑正确中心线树跟踪
改进模型Trexplorer Super在管状物体中心线跟踪中优于现有方法,解决重复分支和提前终止,新数据集验证效果。
基于视觉物体属性的常识推理研究
提出OPTICS评估框架,12个VLM零样本推理远低于人类(计数<40%,比较70%),在照片、反事实、物理功能、高计数上表现差。