11081 条条目 · 106 个活跃源
2026年8月7日
04:00
arXiv cs.CV

大、亮或隐形:三维CT基础模型的冻结特征基准测试

三维CT基础模型基准测试:无通用最优,检出率取决于病灶大小与对比度,小低对比病灶仍难。

04:00
arXiv cs.CV

Diff-VF:基于扩散模型的免训练高质量长视频生成

提出免训练框架Diff-VF,融合三种策略将短视频扩散模型扩展为长视频生成,兼顾时间连贯与运动多样性。

04:00
arXiv cs.CV

尊重零样本不确定性:测试时自适应视觉语言模型的保守校准

TTA提升精度但损校准,提出ZAEC:以零样本熵为参考做最小温度缩放,无需标签,多数据集上ECE最低。

04:00
arXiv cs.CV

PaCoNet:面向平行坐标的深度数据提取方法

首用深度学习方法提取平行坐标图数据,超越基线,并构建大规模数据集,实现自动分析与重设计。

04:00
arXiv cs.CV

DARAD:面向持续遥感图像-文本检索的双适配器与排序感知蒸馏

提出DARAD框架,结合双适配器与排序感知蒸馏,缓解遥感持续检索中对齐空间扭曲,兼顾新数据适应与旧数据保留。

04:00
arXiv cs.CV

从失败中学习:基于硬负样本的检索中心思维链用于统一多模态检索

提出UniME-R1框架,借硬负样本模拟检索失败,生成检索中心思维链,优化候选重排与全库重检,显著提升统一多模态检索性能。

04:00
arXiv cs.CV

迭代还是加宽?测试时细化何时有助于LiDAR场景补全:证据几何、训练覆盖与计算量的受控研究

受控实验表明迭代细化仅对连续缺失胜过加宽模型,对稀疏删减不如训练增强,对附加杂波无效,且计算成本更高。

04:00
arXiv cs.CV

面向SAM3图像分割的通用概念扰动

提出通用概念扰动UCD,首个针对SAM3的跨概念对抗攻击,显著降低分割性能且可迁移至新模型。

04:00
arXiv cs.CV

下一张截图知道答案:面向移动GUI智能体的门控后见之明蒸馏

提出门控后见之明蒸馏,用下一截图作特权信息,仅在学生失败时蒸馏,提升移动GUI智能体成功率。

04:00
arXiv cs.CV

Wan-Animate-2:拓展角色动画的应用边界

提出端到端角色动画框架,摒弃显式运动提取,支持文本控制视角,轻量版实现实时流式生成。

04:00
arXiv cs.CV

Bar-JEPA:利用联合嵌入预测架构从柱状图中提取数值

Bar-JEPA利用自监督联合嵌入预测架构提取高语义特征,简化解码器恢复柱状图数值,优于监督基线。

04:00
arXiv cs.CV

域引导的候选选择用于智能体图像编辑:以阴影去除为例

商用视觉模型直接编辑阴影易出错,基于物理的智能体候选筛选流程在基准上CDD降47%以上。

04:00
arXiv cs.CV

Dense-Cast:面向降水临近预报的轻量级深度学习架构集成

融合密集连接、残差与注意力的轻量级模型,实现半小时降水临近预报,印度东北部验证精确。

04:00
arXiv cs.CV

EvReflection:事件驱动微动力学实现反射去除

提出事件驱动的反射去除网络EvReflection,利用微动态分离图层,构建首个真实数据集,性能最优。

04:00
arXiv cs.CV

样本自适应潜在奖励:不确定性引导的扩散后训练

提出SURE框架,学习奖励分布,用不确定性引导扩散后训练,提升偏好预测并达SOTA。

04:00
arXiv cs.CV

EmoWorld:用于可控情感视频生成的解耦情感场

EmoWorld解耦情感视频中的氛围、语义与时间因子,通过VAS/SAS/TAS提升情感对齐度、降低波动,支持27类情感生成。

04:00
arXiv cs.CV

置信度至关重要:利用多视图几何先验提升GS重建质量

集成多视图预测的深度/法线先验及置信度图,可显著改善3DGS几何重建,尤其对高光物体效果突出。

04:00
arXiv cs.CV

基于CT的合成数据生成框架用于患者体位评估

提出从CT扫描合成生成深度图与X光片训练数据,预训练使上踝关节体位评估准确率提升11个百分点。

04:00
arXiv cs.CV

CFGPNet:基于交叉注意力的融合梯度编程网络框架用于多光谱目标检测

提出CFGPNet,用交叉注意力与梯度编程提升多光谱目标检测,在五个基准上实现高性能与效率平衡。

04:00
arXiv cs.CV

HOPE:从单目视频估计手-物体压力

提出HOPE,用单目视频估计手物接触压力,泛化至裸手。

04:00
arXiv cs.CV

支撑操作因子分解:受控干预下冻结视觉编码器的组合读出

提出因子化读出,分解支持显著性与操作后验,消除操作洗白,标准基准高精度,但MuJoCo暴露边界。

04:00
arXiv cs.CV

学习绘画与摄影构图分析的视觉表征

对比类人感知与微调模型,前者可解释,后者性能优但牺牲跨域泛化。

04:00
arXiv cs.CV

BendTwin:基于弯曲感知可微分弹簧-质量模型的鲁棒稠密到稀疏物理重建

提出弯曲感知可微分弹簧-质量模型BendTwin,用弯曲约束增强稳定性与变形预测,优于基线,可从稀疏RGB-D视频重建。

04:00
arXiv cs.CV

利用输入自适应优化攻击视觉Transformer的对抗性效率退化综述

综述针对ViT输入自适应优化的对抗效率退化攻击,比较两种攻击,用计算量等指标度量,并探讨防御。

04:00
arXiv cs.CV

PRISM:分布门控流匹配用于可控无配对图像翻译

分布门控流匹配实现可控无配对图像翻译:逐特征门控依据源特征到目标分布的距离决定保留或改变,兼顾真实与结构。

04:00
arXiv cs.CV

深度引导的拥挤场景视频目标计数

提出深度引导检测器,融合跨模态注意与遮挡预测,统一去重,新数据集上平均误差降62%。

04:00
arXiv cs.CV

迈向可部署的孟加拉手语识别:专家验证数据与轻量级注意力模型

提出专家验证的孟加拉手语数据集RSBdSL38和轻量注意力模型,手机端高效运行,准确率96.37%。

04:00
arXiv cs.CV

MASS:具有权威共享状态的多玩家世界模型

MAS将世界动态与视角渲染解耦,用逻辑引擎推进权威共享状态,渲染引擎生成一致视角,实现可扩展的多智能体世界模拟。

04:00
arXiv cs.CV

OTLesMix: Wasserstein Barycenter and Optimal Transport Map for Synthetic Lesion Generation with Diverse Shapes and Locations

04:00
arXiv cs.CV

FLAIR超分辨率会抹除还是幻觉出小的白质病变?

超分辨率主要抹除真实小病灶而非产生幻觉,且随层厚增加;仍优于原始厚层,ECLARE最佳,INR无优势。

04:00
arXiv cs.CV

TLNM:基于Mask R-CNN的智能手机照片牙齿检测、编号与分割及外部验证

基于Mask R-CNN的智能手机牙齿检测编号分割模型,内外部验证精度高,可支持远程牙科筛查。

04:00
arXiv cs.CV

VLAff:面向统一可操作属性的视觉-语言-可操作模型

提出VLAff,从人类视频提取视觉、抓取和轨迹可操作属性,构建大规模数据集,统一预测并支持真实机器人零样本操作。

04:00
arXiv cs.CV

UQ-Loc:不确定性感知的LiDAR场景坐标回归

提出UQ-Loc,以各向异性高斯协方差头预测不确定性,用NLL损失和加权求解器,提升定位精度且校准良好。

04:00
arXiv cs.CV

面向超高分辨率静态360度远程呈现的多层系统

融合8K全景与4K云台,分层优化背景与动态前景,兼顾超高分辨率和交互性。

04:00
arXiv cs.CV

全局到腕部:任务条件下的未来腕部建模用于细粒度机器人操作

提出W2-VLA,通过任务条件下的未来腕部建模预测腕部状态,提升细粒度与接触敏感操作,动作生成频率超80Hz。

04:00
arXiv cs.CV

检视监督视觉网络中相似性发展的训练动态

提出DSI框架,揭示监督视觉网络训练中相似性感知经三阶段演化,并发现错误精炼现象。

04:00
arXiv cs.CV

XEWorld:动作条件世界模型能否泛化到未见过的机器人形态?

世界模型仅按视觉相似性匹配,无法泛化到未见机器人,需像素动作与时空对齐,小样本适应会遗忘已见形态。

04:00
arXiv cs.CV

面向第一人称助手的视觉意图定位

首个第一人称视觉意图定位数据集,提出链式推理指令调优,显著提升统一视觉定位能力。

04:00
arXiv cs.CV

零样本视觉-语言控制中的视觉接地

多数视觉语言模型零样本控制未真正基于视觉;图像正对照验证信息充分,加装监护后平衡准确率达0.954。

04:00
arXiv cs.CV

可逆不可学习示例:迈向深度学习时代的版权保护

提出可逆不可学习示例机制,以互信息最小化生成扰动阻止非法训练,双提取器消除水印影响,实现全面版权保护。

04:00
arXiv cs.CV

Afford-X:面向任务操作的可泛化轻量可供性推理

提出大规模数据集与轻量模型,实现任务操作的泛化可供性推理,性能提升逾一成,推理速度快近五十倍。

04:00
arXiv cs.CV

Prior-SG:任意结构环境下任务与先验驱动的场景图区域分割

Prior-SG将场景图生成视为概率对齐,融合任务与先验,结合多尺度特征,实现无墙环境下语义区域分割及零样本拓扑灵活。

2026年8月6日
04:00
arXiv cs.CV

LoRetta:面向全球尺度遥感稠密影像匹配的基础模型与大规模数据集

LoRetta将稠密匹配重构为定位-配准,构建全球多时相基准LEVIR-GM,AUC达83.3%,超越基线,延迟降低47.8%。

04:00
arXiv cs.CV

利用深度学习推进电线杆与标志检测

基于DETR检测电线杆和标志,精度达90.43%和88.26%,倾斜角误差1.01度,并公开数据集。

04:00
arXiv cs.CV

PADFormer:基于稀疏视角图像的姿态无关异常检测

提出姿态无关异常检测新模型,用ViT直接重建无异常图,免3D重建,在PAD基准最优,少样本检测亦佳。

04:00
arXiv cs.CV

GEB-Bench:多声部讲述的抽象结构

新基准测试抽象结构的多声部识别,失败有规律:模型能识别单声部,但跨声部映射普遍失败,仅前沿模型能缩小差距。

04:00
arXiv cs.CV

感知先于推理:视频理解与问答中的动态潜在推理

提出动态潜在推理法,先感知后按需推理,在九项视频问答基准上提升准确率,生成少于20个词元。

04:00
arXiv cs.CV

教基础模型读懂毫米波:用于人类行为理解的姿态引导运动学表示

提出mmMind,以3D姿态监督雷达编码器预训练,结合语言模型实现行为理解,性能优于基线。

04:00
arXiv cs.CV

TRNet:地形引导的频率校正与结构感知解码用于多模态水稻田分割

提出TRNet,融合高程与坡度校正地形干扰,联合语义边界内部分割,水稻IoU提升9-19个百分点,减少陡坡误检。

04:00
arXiv cs.CV

Radar4D-VLM:冻结语言模型上的提议引导时序4D雷达推理

提出仅用4D雷达的时序VLM,通过提议引导令牌化实现场景与运动推理,目标召回达98.13%,优于基线。