11041 条条目 · 106 个活跃源
2026年8月14日
04:00
arXiv cs.CV

CoverPrune:基于最优传输的覆盖驱动三维视觉语言模型令牌剪枝

提出覆盖剪枝框架,将推理时令牌剪枝建模为最优传输,用证据覆盖取代多样性,高效保持性能。

04:00
arXiv cs.CV

GeoCache:通过几何增量传输实现多视图纹理扩散的免训练加速

几何增量传输实现免训练多视图纹理扩散加速:旋转锚视图,两倍以上加速且保真度最佳。

04:00
arXiv cs.CV

NARU:日本极长视频中叙事演变与文化细微差别理解的基准

提出NARU基准,含1481问、155视频,评估日本长视频叙事演变与文化理解,揭示多模态模型不足。

04:00
arXiv cs.CV

HPSD:用于文本-图像到视频扩散模型的混合策略自蒸馏

提出混合策略自蒸馏(HPSD),教师以TI2V模式指导T2V学生,显著增强模型基础生成能力。

04:00
arXiv cs.CV

BraTS-GoAT分割的可靠性分析:深度集成不确定性的受控稳健性研究

脑肿瘤分割可靠性研究:深度集成在分布偏移下,成员分歧比单模型置信度更早警示错误,校准更优。

04:00
arXiv cs.CV

UniCon-Former:统一卷积Transformer,手势识别所需的一切

提出统一卷积Transformer融合局部全局,降开销,手势识别中以更少参数计算量达最优。

04:00
arXiv cs.CV

基于损失引导的多专家GAN手语视频合成

提出损失引导多专家GAN合成手语视频,三判别器分工,统一损失稳定训练,低显存高PSNR,可部署于消费级硬件。

04:00
arXiv cs.CV

通过多光谱成像重建历史手稿:对比度在评估图像质量和可读性方面的潜力

对比度指标与专家评分及全参考度量高度相关,优于通用指标,可客观评估手稿重建质量与可读性。

04:00
arXiv cs.CV

SNM-VFI: 对称非线性运动引导的生成式视频帧插值

提出对称非线性运动引导的生成式视频插帧法,无需训练,融合光流与扩散模型,置信图提升细节,性能优异。

04:00
arXiv cs.CV

Edit2TikZ:面向TikZ科学图形编辑的全面且富有挑战性的基准

提出科学图形编辑基准Edit2TikZ,评估多个多模态大模型,发现性能不佳;混合训练显著提升编译成功率至83.4%。

04:00
arXiv cs.CV

任务向量何时足够?隐式多模态上下文学习的实证理论

选择-实现假说:任务向量仅当演示变化跨查询共享时有效;查询特异或分布式结构需更强干预,可成本感知选法。

04:00
arXiv cs.CV

上下文匹配蒸馏:自回归视频蒸馏中的教师因果性

提出上下文匹配蒸馏(CMD),用因果教师对齐监督与生成时可用信息,提升长短视频生成及相机控制性能。

04:00
arXiv cs.CV

临床可控视网膜图像生成:基于基础模型潜空间的评估

基础模型潜空间可生成保留临床信息的视网膜图像,但存在合成-真实表征差距。

04:00
arXiv cs.CV

StreamTTT:调和流式视觉语言模型中的实时感知与长期记忆

StreamTTT将长期历史存入注意力外的快速权重,保留短缓存,在OVO-Bench上实时感知与回溯分别提升1.4和3.7点。

04:00
arXiv cs.CV

基于交叉注意力与潜在稀疏专家的细粒度动作识别

提出FineX模型,融合RGB、姿态热图与骨架图,经交叉注意力与稀疏专家,Gym288准确率提升7.6%,达SOTA。

04:00
arXiv cs.CV

UniTexture:面向视觉-语言-动作模型的跨任务通用对抗纹理

提出UniTexture,用单一纹理跨任务攻击VLA模型,成功率由90%降至48.4%,且跨套件/模型迁移。

04:00
arXiv cs.CV

TraVEL:轨迹引导的视频嵌入学习用于驾驶视频检索

轨迹引导的视频嵌入学习,用轨迹相似度作为奖励微调,提升驾驶视频运动相关检索,推理无需轨迹。

04:00
arXiv cs.CV

DreamX-Phi 1.0:面向机器人操作的动作条件视频世界模型

提出动作条件视频世界模型预测操控未来帧;用几何编码、深度与掩码保一致,蒸馏加速,获挑战赛第一第二。

04:00
arXiv cs.CV

MapRoute++:代理引导的语义路由用于视觉概念遗忘

提出语义路由增强的视觉概念遗忘,保留相邻概念,基准平均优于SOTA 12.1%。

04:00
arXiv cs.CV

MLLM路由异构集成实现鲁棒跨数据集图像分类

提出ARMDIL,用多模态大模型动态路由图像至最适视觉骨干,提升跨数据集分类鲁棒性与可解释性。

04:00
arXiv cs.CV

V-RAE:重新思考视频生成中的潜在空间

V-RAE用冻结视觉基础模型构建语义化视频潜空间,兼顾重建与生成,训练快6倍。

04:00
arXiv cs.CV

GS$^{2}$CI:基于大视觉模型先验的快照压缩成像鲁棒高斯泼溅

提出用3D高斯泼溅和大视觉模型先验从单次快照压缩测量重建高质量3D场景,并用OSGR策略提升鲁棒性。

04:00
arXiv cs.CV

TabSOM:基于自组织映射的表格到图像编码方法

提出基于自组织映射的表格转图像编码,保留特征关系,性能领先且具可解释性。

04:00
arXiv cs.CV

Alaya-EVOKE:从线性扩展监督到无尽世界

Evoke用外部状态库和线性监督实现长时程交互生成,三步学生模型无需分类器引导,抗漂移并达到领先性能。

04:00
arXiv cs.CV

SCULPT:面向3D部件生成的减法组合

提出SCULPT,用减法组合迭代分割3D对象,联合生成部件与剩余体,实现高质量部件分解与整体重建。

04:00
arXiv cs.CV

PlayWorld:通过智能体玩家在长期目标下评测世界模型

用多模态智能体玩家测试世界模型建立PlayWorld基准,评估几何一致性等四维,模型长期交互不可靠。

04:00
arXiv cs.CV

语义辐射场:真实场景中空间推理的模拟器

提出以语义辐射场为模拟器,统一几何外观语义,支持查询,生成真实环境以训练评估空间推理。

04:00
arXiv cs.CV

视觉语言模型是脆弱的多语言关联器

提出M²BIND基准,发现VLM跨语言绑定脆弱:跨语系/文字时崩溃,内部层后移且因果强度减弱。

04:00
arXiv cs.CV

MASCOT:面向复合属性文本-图像检索的模型感知子模覆盖

MASCOT将复合属性多样性视为资源分配,在时空联合抑制下保持高早期召回,优于现有方法,但非全面占优。

04:00
arXiv cs.CV

AutoDesign:面向长周期智能体化设计的元框架优化

该框架通过元框架优化递归自改进,论文转海报得分78.32,超商业系统7.45分。

04:00
arXiv cs.CV

自然语言理解在多模态视频登革热诊断中的作用

提出YOLO-CLIP视觉语言框架,帧级登革热检测准确率98.54%,敏感性99.91%,视频级全对,微调与CLIP关键。

04:00
arXiv cs.CV

可审计智能体AI助力甲状腺超声诊断与报告

甲状腺XAgent整合诊断工具生成可审计证据,提升医生诊断一致性至86.2%,减少分割与报告时间。

04:00
arXiv cs.CV

从局部失配到全局影响:优化扩散模型的高效缓存复用策略

现有缓存策略依赖局部相似性,与生成质量不符。提出全局影响缓存,经理论误差界与双层优化,兼顾速度与质量,显著提升视频与图像生成效果。

04:00
arXiv cs.CV

BrainWAM:自动驾驶中语义先验与预测动力学的动作空间协调

提出BrainWAM,以动作空间协调语义先验与预测动力学,实现自动驾驶SOTA性能。

04:00
arXiv cs.CV

H2R-Bench:世界模型中人类到机器人操作视频生成的基准测试

提出H2R-Bench基准,评估人至机器人操作视频生成,发现现有模型在实体一致性、功能交互与任务执行上仍不足。

04:00
arXiv cs.CV

FUSE:通过自适应语义-几何证据获取的主动功能可供性定位

提出主动功能可供性定位任务,FUSE结合自适应语义几何证据获取与不确定性探索,性能最优且计算减少。

04:00
arXiv cs.CV

因果世界模型的统一视角:从观察到表征再到结构

从因果视角统一世界模型,定义因果世界模型,强调捕获实体属性与交互,并关联可辨识性。

04:00
arXiv cs.CV

盲视或受误导时,VLM如何表现?科学图表行为评估

提出SciFigBench评估VLM科学图表理解,发现高感知推理不等于行为可靠,如GPT-5.2幻觉严重,Gemini更稳健。

04:00
arXiv cs.CV

ContactGuard:基于动作条件潜在世界模型的接触前执行监控

接触卫士在接触前以动作条件潜在世界模型预测动作块后果,发现失败风险即中止,无需修改底层策略。

04:00
arXiv cs.CV

探索基于小波的视觉参数高效微调中的稀疏性

提出WaveFT,在小波域学习稀疏更新,实现参数高效微调,视觉任务达SOTA。

04:00
arXiv cs.CV

基于力场构建的可解释ODE式生成扩散模型

提出用物理模型统一ODE式扩散模型,具几何意义,在CIFAR-10上验证了生成速度与质量。

04:00
arXiv cs.CV

HumanTracker:迈向全面且与人类对齐的运动跟踪基准

提出“人类追踪”基准与“人类评分”指标,含153小时动作数据,更贴合人类偏好,可揭示接触与稳定性缺陷。

04:00
arXiv cs.CV

基于解耦提示的免重放类增量持续蒸馏学习

提出解耦持续蒸馏学习,用知识蒸馏提示和分支解耦蒸馏与任务适应,跨任务传递教师知识,提升免重放类增量学习性能。

04:00
arXiv cs.CV

基于无监督深度学习的特征点定位与描述子匹配性能估计

提出无需标注的无监督眼底图像配准,利用描述子估计关键点,性能媲美监督方法。

04:00
arXiv cs.CV

无关键点监督的柔性视网膜图像配准描述符训练方法

提出无需关键点检测的无监督描述符学习方法,在公开数据集上精度媲美监督方法,且不受关键点检测器类型影响。

04:00
arXiv cs.CV

SelfDRSC++:基于视频插值的自监督双反向卷帘快门校正

提出自监督双反向卷帘快门校正,采用双向匹配与物理循环约束,将重建视为视频插帧,轻量且高质量。

04:00
arXiv cs.CV

UltraFast-LiNET:面向实时低光图像增强的轻量级多尺度移位卷积网络

提出超轻量网络UltraFast-LiNET,仅用180个参数(PSNR 19.81dB)超越SOTA,实现毫秒级实时低光增强,适合边缘部署。

04:00
arXiv cs.CV

RulerNet:学习透视不变的尺子表示,实现鲁棒的图像尺度估计

将尺子读取建模为关键点检测,学习透视不变表示,实现鲁棒图像尺度估计,并利用合成数据提升泛化。

04:00
arXiv cs.CV

基于最短路径树的拓扑去叶可免叶片-木质分离,单次恢复层级,带叶点云估算误差17.2%,优于传统法。

基于最短路径树的拓扑去叶可免叶片-木质分离,单次恢复层级,带叶点云估算误差17.2%,优于传统法。

04:00
arXiv cs.CV

可泛化的多模态增强手术室专家

提出一种多模态增强的专家模型,仅用RGB图像推导深度、分割和点云,实现手术室三维空间推理,性能领先。