NAST:通过否定感知选择性训练提升医学视觉语言模型的否定处理能力
提出NAST方法,利用因果追踪调制梯度更新,增强医学视觉语言模型对否定与肯定表述的区分,不损害通用对齐能力。
ActFER:基于主动工具增强视觉推理的智能体面部表情识别
提出ActFER,将表情识别重构为主动视觉证据获取与推理,用UC-GRPO强化学习优化,优于被动基线。
高分辨率文本密集图像翻译中MLLMs的全局-局部双感知
提出GLoTran全局-局部双感知框架及GLoD数据集,提升高分辨率文本密集图像翻译的完整性与准确性。
面向边缘部署的资源高效纯RGB动作识别
提出紧凑纯彩色动作识别网络,参数不到百万,精度高,抵抗光照模糊,遮挡下损失最大。
基于骨架的点监督人体动作分割
提出点监督骨架动作分割,仅每段标注单帧,结合多模态伪标签,性能媲美甚至超越全监督方法,显著减少标注成本。
图像分类中分布外检测训练目标的系统比较
比较四种训练目标,交叉熵损失在远近分布外检测上整体最稳定,其余目标在特定场景下有竞争力。
面向大规模和复杂事件的InSAR相位解缠框架
提出扩散模型相位解缠框架,处理大规模复杂形变与断层相位跳变,实验有效。
CVT-Bench:通过反事实视点变换探测空间状态完整性
提出反事实视点变换基准,评估多模态大模型空间状态完整性,发现孤立精度高估鲁棒性,上下文干扰加剧失效。
对数数学形态学:理论与应用
针对光照变化,提出对数数学形态学框架,采用对数加性律使结构函数幅度随图像强度变化,定义鲁棒算子。
T-VSS:测试时视觉子空间引导,增强视觉-语言模型的对抗鲁棒性
提出T-VSS,直接在视觉特征空间测试时适应,利用低秩子空间修正,增强对抗鲁棒性,且保持精度与效率。
图增强的激光粉末床熔融复杂形状分割用于增强原位检测
提出图增强分割法,保留全局几何信息,应对光照与层间变化,提升L-PBF原位检测鲁棒性。
HandsOnWorld:基于相机解耦手部控制的无约束第一人称视频生成
提出手控第一人称视频生成框架,从无约束单目视频,用普吕克手图解耦相机与手运动,效果优于现有方法。
Hi-Token:用于生成式视觉定位的分层坐标标记化
提出分层坐标标记化与几何奖励,提升生成式视觉定位精度,跨模型基准表现一致。
重新审视形状与纹理依赖:基于类别可分性校准的抑制
提出语义退化指数校准抑制,发现CNN更依赖纹理而非形状,ViT在分类和脑编码中均更鲁棒。
从恢复到跌落:动作后训练如何降低视觉语言模型后期层的深度可解码性
动作后训练使视觉语言模型后期层深度解码骤降,源于多层感知器写入干扰;消融可恢复大部分。
VISOR:基于迭代搜索与超视野推理的智能体视觉检索增强生成
提出VISOR智能体框架,以证据空间和视觉动作校正解决证据稀疏,滑动窗口与意图注入防搜索漂移,经GRPO训练,多基准最优。
μFlow:利用平均图像提升深度伪造人脸检测器的泛化能力
仅用真实图像训练的μFlow单类检测器,借平均图像特征与归一化流对齐,实现跨生成器泛化并超越现有方法。
BAG:面向扩散缓存的预算感知门控
BAG用轻量门控网络按预算动态决定缓存复用,经离线到在线蒸馏训练,在多种加速比下超越现有方法。
面向图像引导神经外科的脑变形数据驱动配准与建模
综述2020-2025年脑变形配准建模的数据驱动方法,分析深度学习策略与评估,指出鲁棒性、基准等局限,展望临床转化。
INFORM-CT:整合大语言模型与视觉语言模型的腹部CT偶然发现管理
提出结合LLM与VLM的计划-执行框架,自动管理腹部CT偶然发现,比纯VLM方法更准确高效。
Edit2Restore:通过预训练编辑模型的参数高效适配实现少样本图像恢复
仅用32-128张样本微调LoRA,将预训练编辑模型转为强恢复器,统一适配器处理多种退化,超越百万数据基线。
LatentAM:基于在线字典学习的实时大规模潜在高斯注意力建图
在线字典学习建图框架,免训练适配多种视觉语言模型,支持大规模场景,高保真重建,实时运行。
扩散偏好对齐中的潜在奖励寄存器
提出潜在奖励寄存器,用中间噪声估计偏好缓解信用分配,形成密集奖励场,支持蒸馏与采样引导,优于基线。
面向资源高效域迁移的摩擦增强漂移模型
提出摩擦增强漂移模型,用线性调度系数改进训练,显著提升域迁移质量,零额外参数,比最优流匹配快约29倍。
如何缓解越野环境中语义分割的分布偏移
提出ST-Seg,通过风格扩展和纹理正则化缓解越野语义分割的分布偏移,提升鲁棒性。
利用多任务全参考信号学习游戏无参考视频质量评估的感知表示
提出多任务学习框架,以全参考指标为监督,免标注学习感知特征,游戏视频无参考质量评估性能优异。
StrAD:面向长视频音频描述生成的流式方法与基准
提出流式音频描述生成方法及基准StrAD,无需时间戳处理长视频,超越现有方法,推动可访问性。
HIMEC:面向遥感图像变化描述的方向变化表示与固定接口解码
提出HIMEC方法,结合方向变化表示与固定接口解码,提升遥感图像变化描述性能,在LEVIR-CC上CIDEr达142.81。
MV2:用于新视角合成的多视角多车辆驾驶数据集
MV2多视角多车辆驾驶数据集,含车/摩托/无人机同步影像,评测大视角变化下的新视角合成,揭示现有方法局限。
评估机器人自我中心图像的近距离危险等级:视觉语言模型能力研究
测试三种开源视觉语言模型对机器人视角图像的危险分级,微调后提升有限,仅Qwen-VL在提示下高危险召回率较高,但空间定位不准确。
推理时正交播种使切片传播方法实现几何对齐的3D器官分割
推理时用三个正交种子切片大幅提升3D器官分割,训练方式影响小,Dice提升21.9%
面向可控时尚检索的属性条件多模态槽分解
提出多模态槽分解法,将文本图像嵌入分解为四个属性槽,实现可控时尚检索,颜色提升显著。
PseudoMapLabeler:面向半监督在线建图的置信度感知伪标签生成
提出教师-学生半监督框架,用置信度感知空间裁剪生成伪标签,在低标注下提升在线建图精度。
表面到骨骼的三维头影测量:从CT导出的外部软组织表面估计隐藏骨骼标志点
CT软组织外表面可推断21个骨骼标志点,层次模型误差2.97mm,证实可行
从视觉控件到UI代码:高效的工具锚定生成
提出工具锚定框架,提取文本颜色证据生成JSX,重建指标优于直接提示与结构化管线,微调可提升模型。
EgoCITE:面向长时程自我中心记忆的上下文增强索引与时间感知检索
该框架使用上下文增强索引和时间感知检索,改进长期自我中心记忆问答,准确率提高4.4%-14.2%,成本降低36倍。
Mr3D-VL:面向多参数三维磁共振成像的通用视觉语言基础模型
提出Mr3D-VL,4B参数多参数3D MRI视觉语言基础模型,采用3D编码器和4D旋转位置嵌入集成多模态,报告生成BERTScore达0.856,超越现有模型。
类别几何监督:实现样本高效的开放世界检测
提出类别几何监督,对齐类别表示间的距离,在少样本下提升开放世界检测的样本效率与未知类召回。
双流形几何引导的表示学习:核空间与数据空间的自适应耦合
提出双流形几何引导的核引导特征变换,自适应传递核几何至数据流形,提升图像分类与算术推理。
面向稀疏标注的开放世界目标检测
提出稀疏标注开放世界检测任务及DPOD框架,通过双模块解决已知/未知目标监督冲突,显著提升未知目标检测性能。
一种提升光伏组件多标签缺陷分类的生成式方法
提出GDI方法,用LaMa修复生成单缺陷样本,稀有缺陷F1提升63.6%,共现错误降低26%。
扩展表示多样性:调制注意力与重建正则化用于视觉定位
提出调制注意力对比头与文本条件JEPA辅助流,结合Objects365-Caption数据,防止表征退化,提升跨数据集视觉定位泛化能力。
VOS-Agent:第八届LSVOS挑战赛(MOSEv2赛道)冠军方案
提出VOS-Agent框架,按目标特征启用专用代理(跟踪/语义),解决微小与语义主导目标分割,在MOSEv2上以69.82%获第一。
双流跨锚点校正:长格式字幕的锚定与对象级锚点的领域局限
DSCC:微调注入对象级视觉锚,双流耦合降低长字幕幻觉,精度88.19%,但跨域受限。
PatchGen:学习软性图像内预测子集以实现视觉泛化
PatchGen通过样本自适应软掩码选择判别性补丁,提升分布偏移下泛化,无需文本监督。
CW-BASS v2:基础模型教师下半监督分割的饱和度感知伪标签选择
提出饱和度感知伪标签选择法,测量教师置信可靠度,严格过滤或自适应下限,避免饱和教师伪标签确认偏差。
NaviDC-OCR:跨越数字与相机拍摄文档的解析导航
提出NaviDC-OCR,融合形变感知与结构解耦学习,解决数字及拍摄文档解析难题,多项基准性能领先。
语义引导实现可控生成:多模态扩散Transformer中的免训练概念擦除
通过操控中间块语义向量,免训练实现多模态扩散Transformer概念擦除,支持可控生成且鲁棒。
超越正确性:混合思维多模态大模型响应行为的基准与对齐
提出PatternEval评估混合思维模型响应模式缺陷,并用PatternRL强化学习对齐,减少跨模式不一致,代价轻微性能下降。
基于智能手机的摄影测量三维身体扫描用于自动人体测量的验证:与商用深度传感器身体扫描仪的比较
智能手机摄影测量3D扫描与商用深度传感器扫描仪在孕妇纵向测量中高度一致(偏差<16mm,ICC>0.8),可替代商用设备。