TMI:文本-图像与图像-图像互补数据合成,提升长尾实例分割
提出T2I-I2I混合管道与VRAIN编辑器,在长尾实例分割中总体AP提升4.0,稀有类AP提升9.5。
深入探讨低秩视觉-语言对齐中的隐式偏见
低秩对齐降低计算且超越全参数,其隐式偏见使模型保守、保持视觉特征线性可分及结构稳定。
Metrics or Mirage? An Audit of Evaluation Inconsistencies in Colonoscopy Polyp Segmentation Benchmarks
多模态3D LUT生成:基于统计特征的StatLUT用于逼真风格迁移
StatLUT通过统计特征解耦色彩与语义,用Transformer生成平滑3D LUT,并支持文本驱动,显著提升逼真风格迁移质量。
改进KidSat模型:整合地理编码与数据质量评估用于儿童贫困预测
通过数据预处理、图像质量筛选和球谐函数地理编码,使儿童贫困预测MAE降低18.83%,在33个非洲国家达0.1658。
LUMI: 基于大语言模型、与分词器无关的无损图像压缩
LUMI提出与分词器无关的LLM无损图像压缩,通过像素嵌入和位置编码,仅微调少量模块,实现跨域鲁棒压缩。
消除零空间:无分类器扩散的引导感知量化
针对无分类器扩散后训练量化忽视双分支结构导致分支漂移,提出引导感知混合精度量化(GAMP)直接校准引导预测。
TVTA:轨迹感知的视位引导时间聚合用于基于事件的唇语识别
提出TVTA框架,通过轨迹感知差分聚合与视位引导时间聚合增强时序建模,在DVS-Lip基准上有效提升事件唇语识别。
SkelGen4D:弱监督的基于骨架的文本驱动网格动画4D生成
提出弱监督骨架驱动4D生成框架,无需骨架标注即可生成文本驱动的网格动画,时间连贯且物理合理,性能媲美全监督方法。
HSA:用于多粒度场景分解的分层槽注意力
HSA提出分层槽注意力,实现整体、语义、实例三级分解,仅用10%标注数据,性能大幅超越平坦基线。
关于动态高斯泼溅的专家混合设计
提出MoDE与MoE-GS两种专家混合策略,分别通过联合优化和独立路由组合,提升动态高斯泼溅的鲁棒性。
UniRef-UAV:面向无人机影像通用指代的多模态基准
提出多模态通用指代基准UniRef-UAV,支持文本/图像/文本+图像查询及多目标定位,并给出轻量级基线UAV-URNet。
进展作为潜在漂移:缓慢演变病理的生成式预测
提出Latent Drift框架,在压缩语义表示中学习变化,解决身份崩溃和插值陷阱,提升慢速神经退行性病变的MRI预测效果。
ARGUS:加速、鲁棒、通用且无监督的细胞追踪解决方案
ARGUS框架无需训练与GPU,通过自适应检测、光流和轨迹重连实现快速高精度无监督细胞追踪(检测0.905-0.971,追踪0.897-0.964,3帧仅5-6秒)。
VEGAS:通过注视实现人类对齐的视频字幕评估
提出VEGAS指标,利用注视点采样注意力对齐字幕,无需训练,显著提升与人类关注点的一致性及下游检索性能。
面向开放词汇内窥镜组合式指代分割的属性检索
提出ReferEndoscopy基准和AR-ERIS框架,基于属性检索实现开放词汇内窥镜组合式指代分割,性能领先。
深度视觉模型中的纹理表征:CNN、视觉Transformer与人类感知的比较
ViTs比CNN更准确模拟人类纹理感知,ViTs间表征一致,且对不同复杂度纹理形成相似表征。
WCog-VLA: 用于端到端自动驾驶的双层级世界认知视觉-语言-动作模型
WCog-VLA通过双层级世界认知(语义推理与生成轨迹演化)实现主动自动驾驶,在NAVSIM上PDMS达92.9 SOTA。
经典与深度镜像对称评分:十三种方法的基准测试
基准测试13种镜像对称评分方法,发现经典HOG描述符性能接近深度特征,速度快300倍,深度特征优势有限。
交换人脸,保留特征:面向智能交通系统中行人隐私的双重目的流水线
提出五阶段流水线,用Roop人脸交换保护行人隐私并保留面部特征,平衡隐私与数据可用性。
Track2Map:机器人手术中具有运动感知姿态优化的在线可变形SLAM
提出在线联合优化相机轨迹与可变形场景的方法,无需先验轨迹,实现稳健SLAM重建,优于现有方法。
通过U-Net与地理空间基础模型集成预测葡萄栽培潜力
集成U-Net与地理空间模型预测葡萄栽培潜力,在ImageCLEF子任务1中排名第二,精度68.32。
DeltaV:统一大多模态模型中的视觉状态更新思考
DeltaV通过增量视觉更新替代全图生成,减少55.6%冗余token,多模态推理提升3.3%,并超越开源模型。
CT-CLIP表示用于多模态肺癌生存预测
CT-CLIP特征提取在多模态肺癌生存预测中优于临床基线,有效区分高低风险患者。
认知结构化多模态智能体:理解、生成与编辑
提出认知结构化多模态智能体,外化视觉记忆实现长程对话高效检索,8B模型性能超32B,推理时间减半。
糖尿病视网膜病变病灶分割的多分辨率特征茎
高分辨率提升微小病灶检测但降低大病灶性能,提出输入级金字塔+UNet++的多分辨率特征茎解决该权衡。
Whareformer:学习在长时自我中心视频中追踪物体位置
首个学习型OSNOM方案,利用可更新记忆和轨迹分配模块,小训练集在三个数据集上达到SOTA。
VocaDet:基于视觉标记化和向量数据库检索的样本驱动开放词汇目标检测与分割
VocaDet通过视觉标记化和向量数据库,无需重训练实现样本驱动的开放词汇检测与分割,支持可扩展识别。
超越轮椅和眼罩:使用INCLUDE-BENCH探究T2I模型中的残疾刻板印象
INCLUDE-BENCH基准揭示T2I模型残疾偏见:多数生成轮椅、多样性低,刻板描绘反映现实关联。
第一人称视频语言模型能否同时捕捉到手部和物体中心的线索?
提出手-物体掩码训练与动态感知解码器,结合分离线索评估方法,提升模型对手部和物体线索的独立推理能力,增强交互理解鲁棒性。
结构化稀疏自编码器跨模态学习一致概念
提出结构化稀疏自编码器,通过组间排他性与组内稀疏正则化,提升跨模态概念一致性,语义对齐提升6.06%,表示效率提升60.81。
Switch-Reasoner:通过强化学习在多任务混合中学习何时思考
Switch-Reasoner基于GRPO自适应选择推理模式,平衡思考与直接回答,减少冗余推理并保持性能。
变换能否揭示真相?面向通用AI生成图像检测的生成式残差学习
提出GenRes和GenRes++框架,通过生成残差学习和注意力机制,提升AI生成图像检测的通用性和性能。
通过几何感知预训练增强上下文全景生成
Canvas360提出几何感知预训练两阶段框架,用1M高质量数据集和并行深度生成技术,提升全景生成 fidelity 与一致性。
WaspMOT:赤眼蜂长期多目标追踪基准
WaspMOT是赤眼蜂长期多目标跟踪新基准,10个长序列评估显示现有方法轨迹碎片化严重,简单拼接可提升性能。
LongE2V:基于视频扩散模型的长时域事件相机视频重建、预测与帧插值
利用视频扩散先验实现事件视频重建、预测与帧插值,通过自回归展开和自适应切换克服长时漂移,性能最优。
OPSD-V:用于训练后少步自回归视频生成器的在线策略自蒸馏
提出在线自蒸馏范式,通过真实长视频监督,减少少步自回归视频生成的长期退化,提升视觉质量和运动动态。
基于几何与梯度的全景户外重建分区方法
提出PanoLOG框架,采用几何与梯度分区策略实现大规模全景3DGS重建,达到SOTA质量并支持块并行训练。
OpenCoF:通过视频生成学习推理
OpenCoF提出视频生成推理框架,利用时序监督和推理令牌,显著提升视频推理能力。
HumanForge:面向人类的深度伪造视频基准与多智能体伪造推理依据
提出HumanForge深度伪造视频基准,多Agent生成18K视频段,揭示零样本泛化与细粒度推理挑战。
SAM-MT:实时交互式多目标视频分割
基于SAM2解耦目标数量与延迟,实现实时多目标视频分割,保持性能。
LTM:面向野火易发地形的大规模地形模型
利用旧DEM作为先验的物理对齐多模态框架,实现高效高精度地形重建,提升野火应急响应能力。
姿态到生物力学:连接3D人体姿态估计与生物力学属性预测
提出轻量插件BioModule,无需修改上游模型,从标准3D骨骼预测生物力学属性,实现可解释运动分析。
Wat3R:无需标注的水下三维几何学习
提出Wat3R框架,无需水下标注,利用未标注视频和跨视图损失,实现水下3D几何估计,性能最优。
基于碰撞时间的动态障碍物规避:利用预训练视觉模型实现非结构化环境下的机器人避障
无需训练,利用预训练模型计算碰撞时间,数据高效地实现真实场景动态避障,精准检测危险并生成正确方向。
ZipDepth:将轻量级零样本单目深度估计带到任何地方、任何设备上
ZipDepth仅6.1M参数,通过知识蒸馏实现零样本泛化,在轻量模型中达到最佳精度-效率平衡。
中文标题:虚假自信:自动标签干扰颈椎分割公平性审计
中文摘要:自动标签导致性能高估约8个Dice点,并因组内方差塌缩引发年龄公平性假阳性,产生虚假自信。
SASGeo:面向GNSS拒止无人机的稳定性感知语义地图定位——一个框架与合成概念验证
提出SASGeo语义定位框架,利用持久结构,合成实验空间语义匹配Recall@1达94.5-95.5%,验证了语义几何在跨视角扰动下有效区分位置。
ConRad:面向影像组学的高效共形预测
ConRad利用边界不确定性等协变量构建自适应区间,在保持覆盖下提升影像组学特征效率。
评估帧率对基于序列的自闭症相关自我刺激手部特定动作分类的影响
每15帧采样下GRU模型准确率达98.75%,水平翻转增强效果最佳,上采样不可或缺。