SAM2Dual:面向长期视频目标分割的免训练双记忆方法
提出SAM2Dual免训练双记忆方法,结合长短时记忆与文本感知,提升长期视频目标分割稳定性。
教会Molmo2Fish:迈向自然语言引导的交互式鱼类追踪
提出用多模态大语言模型交互修正鱼类追踪预测,性能高但自然语言引导仍有提升空间。
面向无人机视觉里程计的图像匹配方法评估
评估图像匹配方法用于无人机视觉里程计;合成数据集下,RoMa最佳,SIFT优于部分最新方法。
当安全凌驾于视觉:探究视觉语言模型中视觉影响与安全对齐的动态关系
安全对齐的VLM在安全指令下拒绝回答,但视觉证据仍影响解码;安全抑制的是表达而非感知,干预可恢复回答。
PCQA-R1:利用强化学习推进泛化的三维点云质量评估
PCQA-R1:首个强化学习大模型用于点云质量评估,结合GRPO反向推理与高斯奖励,跨数据集泛化最优。
PALATE:基于自适应品味演化的多用户人像修图个性化美学学习
共享奖励演化框架,分全局类别用户适配器,循环蒸馏,少量排序即可个性化,偏好预测准确率72.83%
CDGP:对比双高斯过程用于弱监督异常分割
提出对比双高斯过程,仅用训练数据建模正常与异常分布,弱监督异常分割取得最优效果。
VA-Judger:面向联合视频-音频生成的人类偏好反馈奖励建模
提出VA-Judger奖励模型,基于人类偏好数据与思维链,提升音视频联合生成质量,优于现有指标。
ReX-Shot:基于几何与相机约束生成的单图像重摄影
首个统一框架,从单图联合控制视角、焦距和摄影效果,优于现有方法。
SPARC:面向门控三维动态胎儿心脏MRI自动重建的切片到容积流程
SPARC流程结合深度学习,实现胎儿心脏MRI自动重建,速度提升10倍,82.6%病例全自动,临床可部署。
不确定性量化与基础模型在语义分割中的批判性综述
首次系统评估分割基础模型的不确定性量化方法,揭示精度、可靠性与计算成本间的权衡,指出联合优化方向。
Teeth2Point:一种两阶段牙科CBCT感兴趣区域到点云的分割框架
提出Teeth2Point两阶段框架,先定位牙齿ROI再转为点token,用transformer分割,自监督预训练增强鲁棒性,异常病例DSC提升1.44。
DynCur-Geo:面向多模态主动地理定位的动态好奇心奖励塑形
提出动态好奇心框架按目标距离调整内在奖励,平衡探索与收敛,提升多模态主动地理定位性能。
FRAGMENT:基于实体感知变换的文档生成与编辑的因子化图表示
FRAGMENT将文档表示为类型化关系图,分两阶段生成结构内容,支持实体感知编辑,实验验证有效。
面向第一人称视频的视觉语言模型:从手物交互到具身智能
综述第一人称视频视觉语言模型:从手物交互到具身智能,现有模型识别物体强于交互意图,需强化时序推理。
DocClaw:面向智能文档处理的统一智能体系统
DocClaw统一智能体系统将文档处理视为智能体与文档交互,共享状态,性能佳。
迭代微调对复杂历史梵文手稿转录准确性的影响
提出可迭代微调OCR流程,适应手稿布局与外观,减少人工标注,数字化三部复杂梵文手稿并建数据集。
动态频谱变换器用于超高清水下图像增强
提出动态频谱变换器,用频域注意力处理水下图像高低频畸变,提升色彩与清晰度,效果领先。
基于时间表示建模的组合历史图像检索
提出时间分解表示,将历史照片分解为正交时间与内容子空间,支持无监督时间迁移,兼顾组合检索中的日期与物体检索。
面向SFT后医学图像描述的临床结构化代理奖励
提出临床结构化代理奖励优化医学图像描述,结合图像邻域对齐与临床图一致性,提升整体、相关性与事实性。
CamWorldQA:相机控制的世界视频生成的感知质量评估
提出首个相机控制世界视频生成感知质量评估基准,含720个视频,并设计三分支无参考评估网络,性能优越。
EgoHRV:从自我中心系统连续估计心率变异性以评估自主反应与技能
提出新方法,从自我中心视频估计心率变异性,跨域预训练提升精度,使技能评估准确率提高17.8%。
RVLoss:面向自监督LiDAR场景流估计的两轮投票损失
提出RVLoss两轮投票自监督损失,增强LiDAR场景流刚性,Argoverse2上突破SOTA,性能提升20%。
少量病例足矣:MedSAM3 LoRA微调标注效率的实证研究
仅十例标注即可达临床级分割,媲美专家系统,训练快两至三倍。
SED-FOD:散射感知专家分解的少样本跨传感器SAR目标检测
提出散射感知的共享-特异特征分解框架,用于少样本SAR跨域目标检测,性能优越。
CL4D:动态场景下面向视觉-语言推理的对比语言-4D预训练
提出首个直接处理动态点云的四维视觉编码器,用对比学习对齐语言与时空几何,构建四维视觉语言模型,性能大幅领先。
CutMix对语义分割可靠性与鲁棒性的影响
CutMix对分割精度影响轻微,但能提升可靠性,尤其增强分布偏移下的校准与不确定性。
MIFR:一种模态不变与公平的皮肤疾病分类表示框架
提出MIFR框架,融合临床与皮肤镜图像,以多目标损失实现模态不变和公平性,性能与公平性均具竞争力。
EfficientSync:基于形变的参考纹理混合实现实时唇形同步
基于形变参考纹理混合的实时唇同步,保留真实纹理,单GPU达166FPS。
EVADE:带回避的证据验证智能体诊断
EVADE无需训练,以视图一致性门控,不一致则弃答,降校准误差45%。
简单、安全且被忽视:用统计颜色匹配重拾可持续的域泛化
将统计颜色匹配用作数据增强,安全保持结构,提升跨域稳健性,超越深度生成模型,且计算高效。
GrabVG:无人机影像中视觉定位的图注意力绑定方法
提出GrabVG框架,分两阶段预注意假设搜索与图注意力特征绑定,利用稀疏图联合实例内视觉线索与实例间拓扑关系,提升无人机拥挤场景定位精度。
机构图书-视觉元素:从数字图书收藏中提取、分类、去重和标注视觉元素的开源流程
发布开源流程,从哈佛98万卷图书中提取2260万视觉元素,分类去重并标注,用于数字人文研究。
不确定感知的视觉-语言模型艺术史断代
博物馆数据受收藏制度影响,模型时间编码存在纠缠;用不确定回归评估,视觉语言模型优于视觉基线,但仍有偏差。
冻结DINO无需定位器即可定位图像编辑
冻结DINO的补丁扰动响应本身即是定位图,无需训练即可定位图像编辑,AUROC高。
当简洁取胜:面向轻量级语义分割的瓶颈感知上下文建模
提出瓶颈感知的轻量级语义分割框架SiConMo,融合局部与全局上下文,实现精度与效率的最佳平衡。
X-LMC:基于DSA的跨视角时空侧支循环评分
提出X-LMC,首用DSA时空多视图深度学习自动评分侧支循环,优于基线,接近临床一致性。
ForeSightGuide:面向视障人士的精准低冗余前瞻性导航框架
提出前瞻性辅助框架,结合VLM预测障碍物运动,过滤非威胁目标,减少冗余警报至0.299,漏报率仅0.112,提升视障者安全行走。
小规模数据集上的学习状态感知动态生成式数据增强
提出LSADA,基于损失变化构建学习状态,动态调整增强强度,解耦扩散融合兼顾多样性与语义,显著提升。
Falcon Perception-HD:基于强化学习的高密度感知
用GRPO强化学习直接优化感知指标,解决高密度场景性能崩溃,免NMS,提升指称分割,保持存在性判断。
当两种示踪剂意见相左:临床PET/CT分割中的多模态融合研究
评估PSMA与FDG PET/CT多模态融合策略,发现单示踪剂基线更强,融合未能一致提升分割性能。
自动驾驶中的单阶段目标检测器
综述自动驾驶单阶段目标检测器演进,对比主流模型,分析速度精度权衡与挑战。
Mise-en-Scène:扩散Transformer中隐式布局涌现用于人机协同设计
两阶段框架:扩散Transformer隐式草拟布局,匹配放置还原原图,效果最接近真实。
胸部X射线基础模型适应策略的子群性能分析
研究三种适应策略对胸部X光基础模型子群公平性影响,注意力池化性能最佳但公平性无一致规律,需逐任务评估。
GS-VLA:基于高斯泼溅的即插即用视角规范化方法,用于冻结VLA策略
提出轻量即插即用框架,利用3D高斯新视图合成实现视角规范化,无需重训策略,显著恢复视角偏移下的性能损失。
USR-Drive:通过3D高斯与框的联合去噪实现统一驾驶场景表示
提出USR-Drive,联合去噪3D高斯与框,统一动态重建与3D检测,几何与实例互促,实现自动驾驶场景SOTA。
ReWEIGH:校准词元级序数视觉证据以缓解大型视觉语言模型中的幻觉
提出ReWEIGH免训练解码干预,聚合视觉秩证据并与参考校准,将幻觉对象提及减少21.3%,平均延迟仅增1.33%。
全局协方差池化中矩阵对数归一化的正交多项式近似
用多项式近似矩阵对数,免特征分解,稳定高效;在细粒度识别和ImageNet上优于谱方法和平方根。
泛化音频驱动的精准鼓手动作合成
提出扩散框架,双目标损失解耦身体与鼓槌精度,实现厘米级精准,并泛化到真实音频。
反事实对比分析
基于反事实对比分析,直接操作数据分布而非决策边界,用StyleGAN2特征保细节,生成质量优于现有方法。