从推理到像素:面向医学视觉问答与分割的接地多模态大语言模型
提出MedREAL框架,融合语言推理与空间定位,经SARP池化与R2V融合提升分割精度,在MedRAVS-13K上超越现有方法。
为AI时代重新思考图像处理:以问题为先的科学进步框架
针对AI时代模型优先研究弊端,提倡问题优先框架,区分问题层次,提出六阶段工作流,推动科学进步。
顺序至关重要:面向视觉-语言推理的中文多格表情包基准
提出中文多图表情包基准,评测大型视觉语言模型的顺序推理,打乱顺序后准确率骤降,暴露不足。
MedFG-VQA:面向轻量级医学视觉问答的低频记忆与图注意力
提出轻量级医学视觉问答框架,用低频记忆增强与图注意力对齐,构建两百万合成数据,低算力达到先进水平。
LLaVAFlow:面向参数高效多模态微调的潜在对齐流保持
提出LLaVAFlow,通过互信息压缩与迁移保留跨模态对齐流,缓解灾难性遗忘,提升下游性能与泛化。
镜头思考:基于智能体推理的一致多镜头视频编辑
提出多指令多镜头长视频编辑智能体框架,利用LLM/VLM协同,确保跨镜头一致,消除编辑幻觉。
高光谱扩散等变成像(HyDiff-EI):一种自监督高光谱图像修复框架
提出高光谱扩散等变成像框架,测试时优化学习单幅损坏图像,等变约束提升鲁棒与泛化,修复优于现有方法。
几何驱动的框架无关物体位姿估计优化
提出基于主轴的几何旋转表示,数据级优化,增强稳定性与对称处理,不改架构即可提升位姿估计精度。
评估器依赖的患者自适应心电导联通道分配
患者自适应的导联分配效果依赖下游评估器;更换评估器后优势消失,需与诊断模型联合优化。
FIDA:特征不稳定性驱动的自监督面部表征攻击
提出FIDA后门攻击,利用特征不稳定性损失规避防御,高成功率威胁自监督面部识别。
Self-OPD:无教师流匹配模型的在线策略蒸馏
提出无教师的在线策略蒸馏用于流匹配,以自探索为监督,拉推优化与奖励融合,超越现有方法。
Aphanta:诊断多模态推理中任务对齐的图像编辑中间态
提出Aphanta框架诊断图像编辑中间态:效用依任务而定,视觉注入、接地与反事实有效,符号构造类失效;正任务平均分0.343→0.445。
AraMS-28k:最大规模公开历史阿拉伯文手稿行级数据集,含页边与插入锚点标注
发布最大历史阿拉伯文手稿行级数据集,含14部书籍、28600行标注,并首创行级插入锚点,恢复非线性阅读顺序。
CGS-SLAM:基于协作高斯泼溅的多智能体SLAM重建
混合式多智能体高斯泼溅SLAM,仅用图像与惯性数据,通过关键帧共享与子图对齐,实现低通信成本高质量重建。
KISS-GS:化繁为简的3D高斯溅射压缩
提出模块化压缩管线KISS-GS,解耦训练与压缩,结合剪枝和图像编码,总压缩达85-319倍,超越集成方法。
约束主体,释放场景:面向长时程自回归视频生成的查询感知记忆路由
提出TetherMem无训练查询感知记忆路由,分离主体与场景查询,减少旧背景依赖,提升长视频场景推进与整体质量。
RubricRM:基于动态评分细则的图像生成与编辑生成式奖励建模
提出RubricRM,用动态评分细则对图像生成与编辑打分,两阶段训练,性能超专用奖励模型,媲美大型专有模型。
前馈3DGS中的逐视图高斯预测实现免训练干扰物过滤
提出免训练过滤方法,利用逐视图高斯预测排除仅部分视图出现的瞬态物体,无需重训或优化,显著提升前馈3DGS新视图质量。
Geo-LoRA:几何感知的子空间演化用于持续学习中的低秩适应
提出Geo-LoRA,通过几何约束调控共享与任务特定子空间的演化,缓解子空间拥挤,实现持续学习最优性能。
TempJail:面向图像到视频生成模型的时间越狱攻击
提出时间越狱框架,针对图像到视频生成模型,利用时域语义组合绕过安全过滤,攻击成功率提升超两成。
基于头皮脑电的虚拟颅内脑电:描绘源成像、颅内推断与重建图景
综述提出目标中心框架,区分事件推断、特征转换与波形重建,强调需独立配对数据集验证虚拟iEEG的增量价值。
基于OCT的AMD与DME病变自动二维及三维分割
AMD/DME的OCT病变2D/3D分割达Dice0.76-0.82,外部数据跟踪生物标志物有效,但非临床验证。
Video-OPSD:利用特权视觉证据实现视频大语言模型中的在线策略自蒸馏
提出Video-OPSD,利用视频中的关键证据帧指导自蒸馏,提升视频大模型推理性能,效率媲美GRPO。
复杂场景下的多人人体运动预测
提出OCSD条件扩散模型,融合历史轨迹、多人交互与物体线索,在HiK和HOI-M3上达最优,大幅降低路径误差。
SpatialCrafter:基于生成式3D代理的单图像世界建模
提出两阶段框架,用全局3D代理生成高保真可探索场景,缓解长期漂移,优于现有方法。
解剖引导的基础模型适配与病例内原型监督用于胎儿超声盲扫标准切面检测
提出解剖引导适配框架,结合病例内原型监督,用于胎儿超声盲扫标准切面检测,F1达67.72,优于基线。
超越分类:隐私驱动图像变换下的任务依赖可学习性
提出计算感知多任务协议评估隐私变换,发现分类准确率相近时其他任务性能差异大,需超越分类评估。
EditaLive!直播场景下的统一角色视频编辑
提出EditaLive框架,基于图像动画模型实现实时角色视频编辑,蒸馏压缩至两步采样,保表情、低延迟,达SOTA。
微分抖动校正用于相衬显微CT的深度学习图像质量指标方法
提出基于深度学习图像质量指标的全微分抖动校正法,无需参考扫描,直接从投影数据估计并补偿抖动,恢复精细结构,泛化于多样生物样本。
MVC-Bench:医学视觉语言模型的校准基准评测
构建MVC-Bench基准,评估医学视觉语言模型校准,涵盖多骨干、模态与域偏移,提出MCM正则化优化校准。
参数高效预训练CT到MRI迁移用于直肠癌分割:性能与校准的权衡
提出SWIFT高效微调法,参数减少70%,肿瘤检出率提升,但存在检测与边界精度权衡,校准误差仍偏高。
跨模态校准与动态抑制用于开放世界目标检测
提出CODE框架,通过跨模态校准与动态抑制解决语义歧义和过度抑制问题,在开放世界检测基准上显著提升性能。
3D CT基础模型无监督自适应用于3D CBCT分割
提出冗余减少特征对齐的无监督域自适应,无需目标标注即可分割3D CBCT,优于现有基础模型与UDA方法。
SSMB:运动模糊下的自监督局部特征检测
提出一种免去模糊的自监督运动模糊关键点检测法,用LDE模块与两阶段训练,多项任务达最优。
ReViCo:通过纠错揭示视觉语言模型在视觉文本理解中的局限
提出ReViCo基准,通过图像文字纠错任务揭示VLM与人类差距大,且感知文本不准确。
Magpie:交互式游戏的实时世界渲染器
Magpie将游戏逻辑与视觉生成分离,引擎维护状态,渲染服务基于白盒帧生成视觉,保留设计性与复现性,降低对完整资源依赖。
PACE:面向快速VLM推理的统一压缩-提取范式
PACE框架免训练同时加速视觉编码器与LLM,仅用10%视觉令牌保留93.8%性能,首令牌延迟提速3.1倍。
以视觉为中心的生成式AI模型:软硬件视角
视觉生成AI需考虑硬件约束,倡导软硬件协同设计,实现多平台可持续部署。
Tessera嵌入的时间敏感性分析
Tessera嵌入的时间敏感性因任务而异:物候分类精度高,稳定类需全监督,时间覆盖可调。
Ancient-Bench:中国古代文物文字识别的跨千年、多介质、多字体综合基准
提出Ancient-Bench基准:2700图像,覆盖三千年、九类介质、七种字体,三类标注;实验表明古文物文字识别仍未被解决。
UniFLM:胎儿肢体超声图像的统一分割与测量
提出UniFLM统一分割测量胎儿长骨,构建FLB数据集,通过语义融合与点回归提升精度与泛化。
LeVJEPA:高效可扩展的视频预训练,无需启发式技巧
提出LeVJEPA,免去目标编码器与重建等启发式,以极小算力超越V-JEPA2,视频预训练更高效。
DINOcular:自监督视觉空间表征
自监督RGB-D视觉空间表征,融合深度几何先验,提升3D感知,保持语义迁移,3D基准优于同类,分割亦具竞争力。
Sidecar:面向角色一致的自由形式视觉叙事的免训练语义复用
Sidecar是免训练的语义增强模块,注入缺失语义以保持角色一致,提升图文对齐。
基于高分辨率航空影像的圣诞树种植园检测——以法国莫尔旺地区为例
针对圣诞树种植园遥感检测难题,提出深度学习与硬负挖掘方法,IoU 0.733,F1 0.846,验证时间迁移性。
PAWBench:我们距离概率对齐的世界建模还有多远?
提出概率对齐标准与PAWBench基准,测试11个视频生成系统,均未匹配真实行为分布。
KnockGS:基于交互响应的物理高斯表示校准
提出KnockGS框架,从外力响应中估计3D高斯物体弹性与密度,校准物理模拟,提升参数恢复与响应保真度。
R2M-Bench:在交互式视频世界模型中通过相对一致性评估重访记忆
R2M-Bench通过同轨迹相对校准区分重访记忆与时间稳定性,NMR与人类判断相关0.547。
TADP:面向单阶段三维目标检测的任务感知变形预测
提出任务感知变形预测,用三重特征精炼与多尺度聚合,任务自适应变形头,KITTI汽车mAP达80.91%超SOTA。
连续容量增长:JEPA世界模型中视觉Transformer编码器的任务复杂度驱动宽度与深度扩展
提出连续容量增长法,让JEPA编码器从最小规模按任务复杂度增宽加深,省参且提升预测性能。