10712 条条目 · 106 个活跃源
2026年10月2日
04:00
arXiv cs.CV

基于时序分割与语义抽象的自我中心与外部视角程序理解框架

多模态工作视频经边界分割与事件卡片抽象,增量构建工作环境模型,实现隐私约束下紧凑可审计的检索。

04:00
arXiv cs.CV

STATERA:利用冻结时序管片实现零样本仿真到现实运动学的隐藏质量估计

冻结时序管片适配V-JEPA,单目视频零样本估计隐藏质心,仿真到现实迁移最优。

04:00
arXiv cs.CV

空间升维用于稠密预测

提出空间升维:将输入提升到高维空间并由3D网络处理,稠密预测性能更优,参数量与推理成本大幅下降。

04:00
arXiv cs.CV

涌现式物体绑定具有有限空间视界

预训练ViT冻结块嵌入可解码同物体信号,但绑定随距离指数衰减至非零下限,呈现有限空间视界。

04:00
arXiv cs.CV

编码却脱节:在激活补丁零结果下分解视觉语言模型失败

三种视觉语言模型中层虽编码答案却因果失活,补丁零翻转;错误分为感知失败、编码脱节、先验覆盖,且可学习。

04:00
arXiv cs.CV

目标检测中的域泛化与合成数据:赋能者、探针与鸿沟

目标检测域泛化研究稀缺;合成数据既是赋能者与探针,又存在合成到真实鸿沟,未来需兼顾定位与分类。

04:00
arXiv cs.CV

可达性不等于泛化:理解装配动作识别中的动–名分解

系统分析三数据集上的动–名分解:泛化主要靠共现插值,失败集中于大词表成分,共享编码器致成分纠缠。

04:00
arXiv cs.CV

看见城市,还是识别地点?VLM城市感知中街景影像较现有城市数据的增量贡献

街景影像的增量价值取决于视觉可读性与本地数据覆盖;部分属性上现有数据已匹敌甚至优于图像。

04:00
arXiv cs.CV

DSSR-3D:3D高斯中视角相关指代的解耦推理

DSSR-3D以解耦推理实现3D高斯视角相关指代分割,免重训练,并提出ViewRef-GS基准。

04:00
arXiv cs.CV

基于双对齐测试时自适应的鲁棒在线航空发动机叶片缺陷检测

ABDD测试时自适应框架,对齐全局风格与局部缺陷,用不确定性伪框过滤,提升域偏移下叶片缺陷检测鲁棒性。

04:00
arXiv cs.CV

EgoRefine:面向异步协同感知的自车参考预测对齐与轨迹条件可靠性感知融合

提出自车参考预测对齐与轨迹条件可靠性融合,缓解异步协同感知特征错位,提升3D检测精度。

04:00
arXiv cs.CV

DramaAgent:智能体驱动的故事视频生成

提出分层智能体框架,将长视频生成分解为故事规划、角色保持、分场合成与反思修复,提升长篇连贯与音画同步。

04:00
arXiv cs.CV

评估受控雾退化下反无人机检测的鲁棒性:雾感知训练与晴空性能权衡

首个按雾浓度分级的基准发现,反无人机检测性能随雾非线性骤降,雾感知训练提升全等级但牺牲少量晴空精度。

04:00
arXiv cs.CV

低接地分数并不意味着评判器未接地:识别多模态监督中的可感知性混杂因素

视觉接地分数受图像编辑可感知性限制,易误判为无依据;可用审计三量识别误报,并辅以未编辑图像检测上界。

04:00
arXiv cs.CV

GPEC:用于心脏视频描述生成的高效预LLM高斯过程嵌入校正

GPEC在大语言模型前校正视觉嵌入,提升心脏超声视频描述质量与内容对齐,推理开销低于0.05秒。

04:00
arXiv cs.CV

解码灾害:基于视觉语言模型与众源影像的多任务地理空间推理灾害制图

提出GRDisaster框架,融合视觉语言模型与众源影像,实现跨视角地理定位与可解释灾害严重度评估。

04:00
arXiv cs.CV

查询无关的可变码率视觉令牌编码

查询无关的可变码率视觉令牌编码:保留全部令牌,按率失真优化分配比特,无需文本,同预算下优于均匀编码。

04:00
arXiv cs.CV

超越像素重建:面向低资源满文历史文献的检索引导字形感知修复

提出检索引导的字形感知修复框架,为低资源满文历史文献引入字形级结构先验,提升修复质量与字形保真度。

04:00
arXiv cs.CV

面向磁共振成像分割的多分辨率特征融合U-Net

提出MRFF模块嵌入U-Net各层,提升MRI分割精度,两个基准数据集上优于先进模型。

04:00
arXiv cs.CV

LENS-GRF:用于痤疮严重程度分级与多评估者临床Oracle分析的带门控残差融合的置换不变病变证据网络

提出LENS-GRF,融合置换不变病变集合与门控残差进行痤疮分级,ACNE04准确率达95.89%。

04:00
arXiv cs.CV

PACT:从视频中端到端学习人体姿态、接触与力

PACT端到端联合学习,从单目视频估计人体姿态、接触与力,结合物理监督与数据标注,性能达最优且泛化。

04:00
arXiv cs.CV

从图像潜空间到模糊规则:胃肠道基础模型的可解释性分析

提出原型模糊规则框架,无需微调即可解释胃肠基础模型特征,精度媲美黑箱方法,并可分析合成医学图像。

04:00
arXiv cs.CV

LEGO-OPD:面向多模态在线策略蒸馏的因子化教师组合

因子化组合语言专家先验与视觉专家似然为单一教师分布,自适应校准视觉监督强度,兼顾视觉定位与语言推理。

04:00
arXiv cs.CV

格式塔:大型多模态交互模型

提出格式塔大模型,通过多模态交互金字塔、统一离散扩散与交互分区架构,增强跨模态整合。

04:00
arXiv cs.CV

Memorizon:超越上下文窗口训练世界模型

样本可覆盖任意长跨度却只评最后k块,按相机共视检索有界潜变量库,重访一致性显著提升。

04:00
arXiv cs.CV

分数稳固,基准泄漏:量化公共脑肿瘤 MRI 分类中的数据集污染

公共脑肿瘤MRI基准存在重复、患者及来源泄漏等数据污染;去重后性能仍稳,准确率难证基准完整。

04:00
arXiv cs.CV

PixelDense:将稠密预测作为像素扩散的表征对齐

PixelDense将SAM2、深度等稠密预测作为像素扩散对齐目标,分流语义与几何梯度,提升生成与编辑。

04:00
arXiv cs.CV

PhysVista:通过感知-推理-评估闭环对视觉语言模型中的物理智能进行基准测试

提出基准PhysVista,以感知—推理—评估闭环评测视觉语言模型物理智能,覆盖真实与生成视频,揭示其物理理解存在显著差距。

04:00
arXiv cs.CV

Vmem-φ:基于膜电位统计的脉冲神经网络低计算量分布外检测

膜电位统计助力SNN低算力OOD检测,提出Gen1-C基准与MDD,高严重度AUROC>0.88。

04:00
arXiv cs.CV

FORTE:面向长视频问答的自适应评分与精确关键帧选择

免训练FORTE自适应评分并精确选关键帧,兼顾相关性与时间覆盖,长视频问答平均准确率最高。

04:00
arXiv cs.CV

离散标注,连续偏好:重新思考面向准确且可泛化美学图像裁剪的监督

提出连续偏好场CPF,从离散标注恢复密集偏好,训练CPIC实现精准可泛化美学裁剪,并重校准基准CPICD。

04:00
arXiv cs.CV

VisionQ:面向计算机视觉定性分析的“VLM作为评判者”分类体系、数据集与基准

首个基于同行评审论文对比图的准则条件视觉判别基准,含分类体系、数据与评估协议,最强VLM评判者准确率仅63.1%。

04:00
arXiv cs.CV

HAWK:重新思考推测解码中的多模态草稿生成

HAWK融合目标层表示与压缩视觉隐状态,建模草稿后目标变化,提升多模态推测解码接受率与加速比。

04:00
arXiv cs.CV

利用视觉语言模型进行增强现实中感知质量评估与自主内容调整

基于视觉语言模型构建AR内容自动评估与调整框架,预测与主观评分相关达0.87,超九成用户认可。

04:00
arXiv cs.CV

什么构建了场景?亮度主导3D高斯泼溅中的几何形成

3DGS几何形成由亮度主导:仅亮度监督接近RGB重建,色度可在几何冻结后重拟合,色度单独监督较差。

04:00
arXiv cs.CV

仅对齐 x:对齐预测,而非表征

表示对齐收益难迁移至像素干净图像预测,JAx对齐跨噪声预测,提升FID与收敛,无需外部编码器。

04:00
arXiv cs.CV

SemanTok:可预测的语义令牌,实现高效自回归视频生成

SemanTok 让冻结 DINO 特征可由各 token 前缀单独重建,实现高语义对齐与视频保真,小模型媲美 3.4 倍大模型。

04:00
arXiv cs.CV

FedMAD:面向遥感图像分类的联邦学习调制感知定向聚合

提出FedMAD个性化联邦学习框架,分离全局与客户端参数,并设计调制感知定向聚合,抑制异构数据下的冲突更新。

04:00
arXiv cs.CV

《Soundwich:分层可控音频的视频生成》

Soundwich将冻结的音视频生成模型改造为生成多条与视频同步、可独立编辑的音频分轨的免训练框架。

04:00
arXiv cs.CV

基于推理与反思的个性化图像生成

提出首个基于用户历史的个性化图像生成基准,含场景与创意两任务,并推出推理-反思循环方法PEARL,指标平均提升15%。

04:00
arXiv cs.CV

手语机器翻译

综述手语机器翻译进展与挑战:数据集与评测不足,需捕捉三维同步结构,强调伦理及与聋人社群协作。

04:00
arXiv cs.CV

VTV-FM:通过变分终端速度闭合的流匹配

提出二阶流匹配框架VTV-FM,以最小化加速度能量推导缺失的终端速度,实现闭式闭合,提升传输几何与生成质量。

04:00
arXiv cs.CV

视频生成模型:后训练与对齐综述

首篇视频生成后训练与对齐综述,提出隐式/显式对齐框架,归纳四类方法、数据基准及开放挑战。

04:00
arXiv cs.CV

视频证据索引:从视频预览中学习该看哪里,面向 Token 预算受限的长视频问答

提出视频证据索引,用低分辨率预览构建高分辨率证据集,联合证据定位与预算规划,自蒸馏提升长视频问答。

04:00
arXiv cs.CV

为过多 Token 买单?基于简单启发式的有效且经济高效多模态 LLM 标注

系统评估短视频VLM标注启发式:准确率≠推断效度,单模态文本可能足够,2×8图像网格约15%成本达全视频理解。

04:00
arXiv cs.CV

VLM低层视觉表征中的几何相似性

提出GeoSim四层框架,分析24项低层视觉任务中AR与DiT表征的几何相似性,揭示共性组织原则及跨任务/模型局限。

04:00
arXiv cs.CV

Lang3DSeg:基于点变换器的无标注开放词汇3D分割

Lang3DSeg首次以点变换器为骨干,实现无标注开放词汇室外LiDAR分割,修正投影深度歧义,两大基准均达最优。

04:00
arXiv cs.CV

先对齐,后推理:面向配音的多模态唇同步评判器

提出无参考ATR多模态唇同步评判器:对齐唇动帧与文本音素后推理内容与时序,七语种及配音任务AUC显著提升。

04:00
arXiv cs.CV

SmoothOperator:通过调制标签平滑增强细粒度开放集识别表征

提出SmoothOP,按样本显著度动态调制标签平滑,提升细粒度开放集识别表征,最高增益4.7%。

04:00
arXiv cs.CV

CtrlWAM:意图与预见对齐的可控世界动作模型

提出CtrlWAM,用模拟器执行扰动动作并配加噪视觉,对齐意图与预见,提升世界动作模型可控性。

← 往后1 / 215往前 →