高效多模态推理的潜在视觉状态
提出EVA框架,通过连续潜在视觉表示与联合优化,提升多模态推理效率与性能。
修剪视觉世界模型评估的长尾
Tailor-Bench揭示视觉世界模型存在长尾差距:常见交互表现好,罕见交互差,模型依赖表面视觉模式。
UniRED:事件引导的统一RGB-D视频帧插值
提出统一多模态框架,融合RGB、深度和事件线索,实现高保真RGB-D视频插值,并构建新数据集,性能优于现有方法。
设计引起的病态:探究视觉语言模型中的证据使用
通过单目尺寸估计诊断VLM证据使用,发现模型依赖目标身份而忽视场景几何,最大模型仍落后于纯文本LLM。
ActiveScope:主动寻找并纠正多模态大语言模型的感知
提出ActiveScope框架,通过语义锚点定位和干扰抑制细化主动修正感知,提升高分辨率图像理解准确率。
跨域小样本分割的层次化空间与通道聚合
提出DHANet,通过层次化空间和通道聚合缓解语义与属性过对齐,结合在线概率语义库,实现跨域小样本分割SOTA。
MotifGen:通过多源生成建模实现未对齐卫星图像的时空插值——以热带气旋为例
提出多源生成模型MotifGen,自监督插值热带气旋卫星图像,融合红外微波数据,生成图像功率谱更真实
MM-TRELLIS:点云引导的多模态自动驾驶3D车辆生成
融合多视图图像与LiDAR点云,通过点云引导生成高保真3D车辆,优于现有方法。
无需训练的跨域小样本分割:基于鲁棒语义表示与匹配
提出无训练框架,利用DINOv3和语义特征重融合、支持增强、混合原型匹配模块,实现跨域小样本分割最优性能。
TrOCR在中世纪手写文本识别中的应用:跨数据集验证的系统消融研究
通过对比归一化、数据增强和层冻结实验,最佳配置字符错误率8.03%,发现冻结浅层不显著影响精度,跨数据集验证中解码器冻结阈值更稳健。
REDI-Match: 面向高效鲁棒密集匹配的旋转等变蒸馏
提出REDI-Match,通过旋转等变蒸馏将VFM语义迁移到轻量等变编码器,以熵对齐消除歧义,速度提升1.9倍,达新SOTA。
UniTranslator:面向端到端图像内机器翻译的统一多模态框架
提出UGAM和SMD模块,解决理解-生成冲突与空间错位,实现SOTA性能。
TIGER:驯服身份、几何与生成先验的高质量面部视频修复
提出TIGER框架,融合身份、几何与生成先验,实现高质量面部视频修复,在身份保真和时间稳定性上达到SOTA。
具有三维感知几何约束的开放词汇鸟瞰图分割
提出OVBEVSeg,用3D几何约束解决开放词汇BEV分割语义升维不一致,在未见类别上超闭集方法15.3 mIoU,推理快2.5倍。
S1-Omni-Image:面向科学图像理解、生成和编辑的统一模型
提出S1-Omni-Image,统一科学图像理解、生成与编辑,采用“先思考后生成”范式,多项基准达最优。
MATCH:基于流匹配的多视图异常检测
首个基于流匹配的多视图异常检测方法,实现对象、图像和像素级异常评分,在消费级硬件上达SOTA性能。
SignNet-1M:大规模多语言手语视频数据集及下游任务基准
跨三种手语的大规模增强数据集,利用3DGS和扩散模型生成视角、背景等变化,显著提升模型泛化性,并提供统一基准。
结构Kolmogorov-Arnold卷积:基于值或滤波器形状的可学习函数——逐边卷积KAN的参数高效替代方案
提出结构KAN卷积,将可学习函数置于卷积结构而非每个边,RF-KAN以0.4M参数在CIFAR上超越传统KAN,形状学习是关键。
面向多模态动作识别的模态感知分布外检测
提出模态感知后验检测器,结合模态预测关系与特征空间分数,提升多模态OOD检测性能。
EgoSAT:一个全面的自我中心流式交互理解基准
首个流式自我中心视频推理基准,包含4800问答对,发现现有模型时序推理困难且存在“自信错误”的严重校准问题。
潜在空间中图像的变换行为
研究经典图像变换对潜在空间的影响,发现编码器未完全消除变换效应,因此数据增强可提升性能。
MedPCFM:融合点变换器与流匹配改进医学点云补全
提出基于PTv3的流匹配方法PCFM,医学点云补全达SOTA,采样步数少,吞吐量提升7倍。
video-SALMONN-R$^3$:学习重看、重问和重答以实现高效视频理解
提出端到端视频LLM,通过强化学习实现重看、重问、重答,无需CoT冷启动,高效提升视频理解性能。
Lite Any Stereo V2: 更快更强的高效零样本立体匹配
提出LAS2超快速零样本立体匹配模型,通过2D成本聚合与三阶段训练,实现高效方法中最高精度与最低延迟。
通过几何感知蒸馏提升文本驱动的视频分割
提出GeoLaV框架,通过单目几何预训练与几何感知蒸馏,增强视频分割时空一致性和语言对齐,达到最优性能。
P-MTP:基于渐进式深度缩放的多标记预测实现高效文档解析
P-MTP通过渐进课程损失与动态起草实现多标记预测深度扩展,文档解析加速5倍且精度损失极小。
推进面向艺术字的场景文本识别:数据集与方法
构建大规模合成数据集WATER-S与WATERec模型,在WordArt-Bench达90.40%准确率,大幅超越现有方法。
MambaRaw:高效4K原始图像重建的选择性状态空间建模
MambaRaw用状态空间模型高效重建4K原始图像,空间-能量耦合上下文建模提升性能,低比特率下PSNR提升1.2-1.4dB。
RetiSEM:面向碎片化生物医学数据的因果模型泛化
提出RetiSEM框架,在碎片化多模态数据上实现低结构误差、高因果准确性,视网膜变量表现为下游生物标志物。
SENTRY: 基于SAM2增强的邻域感知与时序推理记忆的视觉跟踪
提出SENTRY,无需训练,在记忆写入前验证时序一致性,即插即用,提升SAM2跟踪器,多个基准零样本SOTA。
GeoIMO: 基于几何驱动的事件相机独立运动分类
提出几何驱动无标注框架,利用自运动结构区分静态与运动物体,无需学习。
VistaRef:提升指向目标检测中的视觉空间方位感知
VistaRef通过手部姿态嵌入与几何光线建模增强空间方位感知,使指向检测定位精度提升14个绝对点。
Jolia:面向3D CT对比学习的概念级视觉-语言对齐
提出ConQuer方法实现CT报告与图像的概念级对齐,训练Jolia模型在分类和报告生成上超越CLIP基线。
VisCritic: 视觉状态比较作为GUI智能体的过程奖励
VisCritic通过比较操作前后截图验证动作,提升GUI智能体长程性能并提供视觉诊断线索。
基于流的逆求解器在近似什么?一个后验输运视角
后验输运表明源重加权精确,轨迹引导近似误差大、模式坍缩,提出速度校正求解器。
通过几何解耦和动量感知梯度调节的异构知识蒸馏
针对异构知识蒸馏不稳定性,提出SPOFA框架,以LayerNorm解耦特征、MEMA调节梯度,实现高效稳定蒸馏。
基于动态区间编码与先验平衡QUBO重构的量子CT
提出动态区间编码和先验平衡QUBO的量子CT方法,降低规模并提高灰度重建精度,优于现有基线。
ForensicsTok: 取证引导的令牌化建模用于图像篡改定位
将图像篡改定位转为自回归序列生成,引入令牌飞溅解码器与层级专家融合,实现精确掩码预测,优于现有方法。
中文标题:用于稀疏视图CT重建的多级随机即插即用方法
中文摘要:提出多级随机即插即用法,利用小波分解避免梯度估计,加速稀疏CT重建并保持质量。
PatternGSL:一种无模板且可模拟的3D服装结构化规范语言
PatternGSL实现单图到可模拟3D服装的规范预测与解码,无模板依赖。
PointVG-R: 通过视觉思维链将几何推理内化于多模态大模型以实现精确指点定位
提出PointVG-R,结合强化学习与视觉思维链,实现基于指点的精确定位,mIoU提升15.86,达SOTA。
Are Text-to-Image Models Inductivist Turkeys? A Counterfactual Benchmark for Causal Reasoning
VSANet:面向光场图像去噪的视点感知稀疏注意力网络
VSANet通过稀疏注意力和特征细化模块,高效利用全局跨视图相关性,实现线性复杂度的最先进光场去噪。
视觉Transformer中的自适应赫布记忆路由用于少样本学习
提出自适应赫布路由方法,通过MLP动态控制记忆贡献与更新,提升少样本识别准确率和推理速度。
通过参数梯度揭示视觉语言大模型中的训练数据暴露
GradAudit通过梯度签名检测视觉语言大模型训练数据暴露,性能优于现有方法,并发现其低估了未授权数据使用。
BioMedVR:面向生物医学视觉重编程的混淆感知提示专家混合模型
BioMedVR首次将视觉重编程用于生物医学,通过混淆最小化和提示专家混合,在18个数据集上实现优越性能。
面向零样本三维理解的智能体协作认知
提出协作多智能体框架,通过规划与感知智能体的闭环迭代,实现零样本3D理解,在多个基准上达到最优。
ViTexQA:面向视频文本问答的多帧时序感知数据集
ViTexQA强制跨帧文本融合,FrameThinker通过CoT监督微调与时序强化学习提升多帧推理,ROUGE-L提升6.3%。
使用概念注释评估稀疏自编码器的可解释性
提出FBMP匹配与TAPAScore验证框架,发现适度字典大小可最佳平衡可解释性。
SER:语义证据奖励驱动视频推理定位
SER用裁判VLM评估证据相关性与定位质量,加时间惩罚,提升视频推理准确性和证据基础,V-STAR上较基线提升3.0点。