10792 条条目 · 106 个活跃源
2026年9月22日
04:00
arXiv cs.CV

检索几何塑造基于缓存的 CLIP 适配

固定缓存仅换检索编码器,增益从+0.44升至+19.7,证明检索空间是首要设计选择,并提出免训练MARC。

04:00
arXiv cs.CV

视觉-无线融合的多用户定位:一种跨模态Transformer方法

提出视觉-无线跨模态Transformer融合框架,借导频索引CSI实现多用户定位,超越多类基线。

04:00
arXiv cs.CV

AniPrO:基于多维语义推理的可解释动漫图像溯源检测

提出AniPrO多维语义框架,构建均衡动漫数据集与双基准,可解释识别AI来源并提升修复检测。

04:00
arXiv cs.CV

通过深度学习与数据精炼增强对虾疾病检测,构建韧性水产养殖

首次用ViT与自监督学习检测对虾疾病,分类四类状态;监督迁移学习准确率达96%,自监督对比学习达85%。

04:00
arXiv cs.CV

BiView-Touch:通过跨手补全学习双手触觉表征

提出BiView-Touch,通过跨手补全学习双手触觉表征,利用对侧同步信息,在低标签任务中显著提升。

04:00
arXiv cs.CV

ScaleBlind:未知尺度下的点云补全

利用基础图像生成模型从部分点云恢复全局尺度并完成补全,无需真值尺度,性能达最优。

04:00
arXiv cs.CV

LiteTex-GS:面向高斯泼溅的快速轻量级纹理化

LiteTex-GS通过紧凑初始化与渐进分辨率分配、贡献/面积感知剪枝及分辨率感知更新,实现快速轻量纹理化,参数更少、训练更快。

04:00
arXiv cs.CV

面向动作的正确未来:在世界动作模型中学习动作相关预测状态

提出动作相关预测状态,用未来表示监督提升泛化,LIBERO达99.2%,无适配迁移达87.3%。

04:00
arXiv cs.CV

面向高效帧插值的贝塞尔控制点精确运动估计

提出ABC-Inter,用贝塞尔控制点精确估计光流,消除运动模糊并支持非均匀运动,帧插值达SOTA。

04:00
arXiv cs.CV

ProxyBuild:基于网格锚定程序化代理的文本引导结构化3D建筑生成

ProxyBuild以网格锚定程序化代理为中间表示,从文本生成可编辑结构化三维建筑,缓解过平滑与碰撞。

04:00
arXiv cs.CV

GAPS:面向稀疏视角三维高斯泼溅的生成式主动伪视角选择

用扩散模型生成几何一致的伪视角并主动筛选,交替优化三维高斯泼溅,显著提升稀疏视角合成质量。

04:00
arXiv cs.CV

仅凭代数一致性不足以证明潜在动作模型中的时间结构

代数一致性无法证明潜在动作模型学到时间结构;重建即可满足该指标,须用基线校正与破坏配对重训来验证。

04:00
arXiv cs.CV

广播斯诺克中白球识别的规则约束分配方法

将白球识别建模为规则约束分配问题,候选球联合指派到球库存,识别准确率由88.1%升至95.5%。

04:00
arXiv cs.CV

PhysReflect:几何与感知引导的物理合理镜面反射扩散模型

提出PhysReflect,用几何与感知引导扩散及可微损失约束镜面反射,提升物理合理性,实验优于现有方法。

04:00
arXiv cs.CV

CE$^4$L:持续第一人称、第三人称与第一/第三人称视角学习

提出多视角持续学习基准CE$^4$L及参数高效方法VISTA,在视角与任务同步变化下总体最优。

04:00
arXiv cs.CV

面向教室CFD气流分析的360度视频半自动室内几何重建

提出360度视频半自动重建教室几何流程,生成可编辑仿真资产,经验证并低成本支持逐室通风比较。

04:00
arXiv cs.CV

RSPDBench:在物理真实遥感产品退化条件下对地观测任务视觉基础模型的基准评测

提出物理真实遥感产品退化基准,评测视觉基础模型;退化敏感性结构化,复合退化额外降幅最高38个百分点。

04:00
arXiv cs.CV

高分辨率多模态大语言模型中应更关注文本

高分辨率MLLM瓶颈在文本未指定所需证据;EviSpec免训练生成证据规范,三大基准平均相对增益10.4%,并达VQA与幻觉SOTA。

04:00
arXiv cs.CV

基于多模态融合Transformer的手机诱发行人分心检测

提出多模态融合Transformer,融合骨骼动态与视觉外观检测手机诱发行人分心,准确率95%。

04:00
arXiv cs.CV

HOIBlender:融合轻量级检测与视觉语言先验的高效人-物交互检测

HOIBlender融合轻量检测与BLIP-2先验,9轮训练HICO-DET 44.49 mAP。

04:00
arXiv cs.CV

基于视觉基础模型的鲁棒多模态三维目标检测

提出RoboDistill框架,利用SAM等视觉基础模型与知识蒸馏,增强多模态3D检测对分布外干扰的鲁棒性。

04:00
arXiv cs.CV

GARO:面向实时高保真动态高斯泼溅的几何感知冗余优化

提出几何感知冗余优化GARO,通过低梯度与低曲率剪枝冗余高斯,实现紧凑表示,渲染提速2倍且质量稳定。

04:00
arXiv cs.CV

GeoBalance:面向平衡多模态学习的几何感知监测、重建与非对称优化

揭示弱模态流形坍塌(MMC),提出GeoBalance几何感知监测重建与非对称优化,六基准验证有效。

04:00
arXiv cs.CV

SewFusion:为缝纫纸样量身定制拓扑与裁片级几何生成

提出SewFusion统一自回归框架,离散拓扑用下一词预测,裁片级几何用流匹配,在图像文本生成中超越现有方法。

04:00
arXiv cs.CV

基于冠状动脉造影视频的SYNTAX评分临床工作流建模

将SYNTAX评分重构为血管节段级解剖推理,分层对齐临床流程建模,并构建大规模造影数据集,R²提升0.201。

04:00
arXiv cs.CV

PosEviLoc:面向语言三维定位的位置条件化空间证据

PosEviLoc以位置条件化空间证据实现文本到点云定位,五大基准Recall@1平均超MNCL 17个百分点,参数更少、推理更快。

04:00
arXiv cs.CV

迁移视觉解释:跨架构知识蒸馏如何影响模型可解释性

跨架构知识蒸馏中,可解释性对软标签权重远比温度敏感;粗粒度定位可迁移,细粒度归因均不及未蒸馏基线。

04:00
arXiv cs.CV

面向视频生成模型知识产权保护的高效有效水印方案

提出生成中水印方案,可验证合成视频与模型归属,提取精度超99%、验证准确率100%,鲁棒且不影响画质

04:00
arXiv cs.CV

MaskVLA:以视觉掩码对抗视觉-语言-动作模型的轨迹过拟合

MaskVLA随机掩蔽主相机部分视觉,引导模型利用腕部相机缓解轨迹过拟合,仿真成功率提升23.2%。

04:00
arXiv cs.CV

G6D:面向机器人操作的无学习几何驱动RGB-D 6D位姿求解器

G6D提出无需训练的几何驱动RGB-D 6D位姿求解器,模板匹配与轮廓深度优化,无需GPU,CPU可用。

04:00
arXiv cs.CV

PETR:面向视觉语言模型的免训练路由提示集成

提出双提示架构,分别强化已见类判别与未见类泛化;推理时按统计相似度免训练路由,在11个数据集上达最优。

04:00
arXiv cs.CV

崩溃而非复杂度:端到端文档解析的失败条件分解修复

推理模式平均降质,收益集中在看似不复杂却已崩溃页面;检测崩溃并分区域重解析可提升质量。

04:00
arXiv cs.CV

StyleAT:抵御针对人脸识别的语义攻击

提出快速语义攻击 BoundStyle,并据此设计 StyleAT 对抗训练,显著提升人脸识别对未见语义攻击的鲁棒性。

04:00
arXiv cs.CV

基于角度-光谱多样性转换的紧凑型低成本高光谱成像

提出基于角度-光谱多样性转换的快照高光谱系统,用锥形万花筒和双折射滤光片实现稳定单次重建,紧凑低成本

04:00
arXiv cs.CV

PREM:面向长视频理解的前缀引导循环记忆

PREM免记忆token,将视频压成256KiB关联状态,用问题引导K/V调制前缀,长视频基准上领先。

04:00
arXiv cs.CV

超越UV映射:基于表面对齐纹理场的网格纹理压缩

TexF用表面稀疏体素组织纹理,复用3D编解码器,GPU端3DNTC可实时渲染,率失真优于UV方法。

04:00
arXiv cs.CV

重新评估跨物理领域 BLIP 微调中的全局梯度范数不平衡

BLIP跨物理域微调中梯度范数失衡随域变,降学习率近最佳,平衡不保证性能,常用LoRA未调视觉参数。

04:00
arXiv cs.CV

为什么视频扩散模型会违反物理规律?揭示注意力机制中的缺陷

可解释性研究揭示RoPE致空间注意力衰减,运动轨迹早期锁定于不合理位置;提出按去噪步缩放RoPE频率。

04:00
arXiv cs.CV

注意空白:一个精心构建的表单字段检测基准

发布 mini-CommonForms 基准,提供高质量一致标注并评测先进检测方法,助力文档自动化与无障碍研究。

04:00
arXiv cs.CV

哪种地形更好?基于VLM原型的偏好学习用于越野可通行性排序

TravPro把标注转为区域偏好对,在冻结VLM原型上学习偏好分数,蒸馏出密集地形偏好图,成对准确率0.915。

04:00
arXiv cs.CV

基于计算机视觉与不平衡感知学习的传染性牛红眼病检测

评估YOLOv11/v26与类平衡策略检测牛红眼病,RMO改善少数类识别,最高准确率0.99。

04:00
arXiv cs.CV

多模态大语言模型视觉词元剪枝的层感知位置嵌入

提出层感知位置嵌入策略,在定位敏感层用稀疏嵌入、其余层用连续嵌入,提升剪枝后多模态大语言模型性能。

04:00
arXiv cs.CV

VISTA:视频注入式风格化文本到动画生成

VISTA以两阶段框架融合文本内容与参考视频风格,无需配对三元组,生成可控风格化3D人体动画。

04:00
arXiv cs.CV

BindCLIP:面向组合式视觉语言评分的一种平衡耦合

BindCLIP用令牌-图块-深度平衡最优传输耦合,读取冻结CLIP的组合关联,提升多个基准。

04:00
arXiv cs.CV

用于跨域小样本分类的免训练谱转导精炼

免训练谱转导精炼STR,在冻结特征上构建k近邻图谱坐标,迭代精炼类原型,提升跨域小样本分类性能。

04:00
arXiv cs.CV

OnlineWM:面向有效世界建模的因果感知主动在线学习

提出 OnlineWM 在线框架,融合主动在线学习与因果感知微调,提升世界模型动作可控性与泛化。

04:00
arXiv cs.CV

VGGT-Prime:面向高效视觉几何Transformer的计算自适应混合注意力头

揭示VGGT注意力头架构冗余,提出计算自适应混合注意力头,动态分配计算模式,8倍加速且性能相当,结合现有方法达14倍。

04:00
arXiv cs.CV

Mira-Scene:面向生成式3D场景的像素对齐布局

提出组合式3D场景重建框架Mira-Scene,用有界规范坐标图替代稀疏位姿回归,以像素对齐的密集对应恢复物体布局,无需场景级标注,精度显著超越基线。

04:00
arXiv cs.CV

面向三维医学分割的置信度感知教师-学生蒸馏

提出置信度感知教师-学生蒸馏,仅需单层点提示,心脏MRI分割较最优半监督提升43.6%。

04:00
arXiv cs.CV

PRISM-RAG:面向烟草产品与立法政策推理的多模态超图检索增强生成

PRISM-RAG多模态超图RAG解决跨辖区烟草法规消歧,正确辖区检索率93.9%,优于标准RAG。