10712 条条目 · 106 个活跃源
2026年10月2日
04:00
arXiv cs.CV

Hob-VL:基于视觉的布尔推理基准

提出Hob-VL视觉布尔推理基准,含6000道是非题和1000道识别题,揭示模型准确率仅约50%。

04:00
arXiv cs.CV

面向可泛化深度伪造检测的交叉重建再审视

重新审视交叉重建,提出保留伪造痕迹多样性的解耦框架,结合掩码频率感知重建,提升深度伪造检测泛化性。

04:00
arXiv cs.CV

SuperMotion:面向文本驱动人体运动编辑的源保留去噪

提出SuperMotion:在反向每步复用源运动,学习保留门与干净空间锚点,无需编辑掩码,提升编辑精度并抑制时序细节衰减。

04:00
arXiv cs.CV

SALD:扩散模型的自参考优势学习

提出SALD自参考训练框架,用同模型双噪声路径误差差加权,无需外部教师或额外参数,提升生成质量。

04:00
arXiv cs.CV

VTR-Bench:评估视频生成中视觉文本渲染的系统性基准

提出VTR-Bench,评测视频生成视觉文本渲染,含300提示与自动评测,发现11个模型普遍不佳。

04:00
arXiv cs.CV

在消退之前:在推理阶段强化 VideoLLM 中的时间表征

VideoLLM 的时间信息在中间层涌现却向输出层逐渐消退;无需训练的时间激活注入法可有效强化时间推理。

04:00
arXiv cs.CV

PAGER:通过几何与关系蒸馏实现局部到全局对齐

提出PAGER,无标签蒸馏几何与关系,将局部特征对齐冻结全局3D语义空间,超越监督微调并提升迁移。

04:00
arXiv cs.CV

FedCKA:表征引导的层个性化实现跨驾驶域联邦3D感知

FedCKA用CKA相似度动态生成聚合掩码,选择性共享一致层,跨域联邦3D检测NDS提升7个百分点。

04:00
arXiv cs.CV

VoxelSynth3D:基于配对合成CLINIC-Metal基准的可解释体图像域金属伪影校正

提出免训练的三维图像域金属伪影校正框架VoxelSynth3D,并构建配对合成基准;留出集上稳定降低组织误差,近金属处有结构折衷。

04:00
arXiv cs.CV

数据稀缺条件下长尾出血性病灶分割的合成训练

提出无需真实病灶标注合成训练框架,用于数据稀缺下长尾出血病灶分割,cSS/CMB上优于传统滤波基线。

04:00
arXiv cs.CV

Oneira:从开放式生成到视频世界模型中的开放世界交互

Oneira用编码智能体维护可扩展世界状态,使视频世界模型中新生成实体可交互、交互结果持久。

04:00
arXiv cs.CV

超越域级适应:面向间隔的语义-外观交互校正及其在个性化联邦视觉-语言模型中的应用

MOSAIC以决策感知有害性评分建模类-域残差交互并做低秩校正,提升个性化联邦视觉-语言模型精度。

04:00
arXiv cs.CV

并非所有错误都能靠规模扩展消除:视觉语言推理中规模扩展的止步之处

提出可分离定律,刻画视觉语言模型性能随语言主干规模与视觉token数的变化,发现部分能力永不受益于扩展,并给出算力分配规则。

04:00
arXiv cs.CV

面向越南语视觉问答的多层融合Transformer视觉与文本表示融合

提出多层融合Transformer与交叉注意力,聚合多层图文特征,在越南语ViVQA上优于基线。

04:00
arXiv cs.CV

MLLM评委真的在评判编辑吗?在经验证质量保持的图像编辑评估中审计偏差

提出EditJudgeBias基准,经质量保持验证后审计五个MLLM评委,发现无关线索均造成超出自身噪声的偏差。

04:00
arXiv cs.CV

重新思考扩散模型中的记忆缓解:强化文本条件

提出免训练法:高斯平滑重分配交叉注意力,强化内容词元并抑制填充,兼顾提示对齐与缓解记忆。

04:00
arXiv cs.CV

DiVid:诊断视频生成模型中特定维度的多样性坍缩

DiVid将视频生成多样性分为语义、风格、运动等六维诊断,发现全局高分模型仍在运动与镜头维度坍缩。

04:00
arXiv cs.CV

当文生图助力编辑:去噪期间条件作用的影响

统一编辑器可在去噪中有界切换至文生图任务,借其能力提升编辑质量,并靠切换时机平衡质量与源图保持。

04:00
arXiv cs.CV

架构采样:通过冻结视觉-语言模型中的计算多样性实现测试时扩展

提出免训练架构采样,通过复用解码器层块产生多样计算路径,pass@9平均提升6.58个百分点。

04:00
arXiv cs.CV

MEGA:通过空间视觉蒸馏从3D高斯泼溅中提取对象级网格

提出MEGA,通过空间视觉蒸馏从3DGS提取对象级水密网格,实现高精度占用与逼真渲染。

04:00
arXiv cs.CV

3DROID:一个可渲染的3D高斯数据集,附带逐场景实测可靠性

研究外参可靠性对前馈3DGS的影响,提出校准感知流程,将重建场景锚定到机器人度量工作空间,发布带场景级可靠性信息的可渲染数据集。

04:00
arXiv cs.CV

连续条件化VLA:融合肌电与视觉任务描述符

提出肌电条件化EC-VLA与视觉标注VA-VLA,在杂乱分布外场景下均显著优于语言提示基线。

04:00
arXiv cs.CV

ATI-VLA:通过可操作对齐与自适应注入的以动作为中心的预测式视觉-语言-动作模型

共享码本对齐观测与动作表征,轻量侧路自适应注入预测潜变量,以动作中心单目标训练,仿真与真机均达SOTA。

04:00
arXiv cs.CV

FFBL-Coop:关联解耦的协同3D多目标跟踪

提出"先融合后绑定"的FFBL-Coop,解耦实例准入与身份管理,提升协同3D多目标跟踪精度与连续性。

04:00
arXiv cs.CV

PhysDEM:稀缺测量下时空场生成的物理定义能量匹配扩散

提出PhysDEM,融合物理方程与稀疏观测,无需全场地数据即可生成多可能时空场。

04:00
arXiv cs.CV

GIFTBench:诊断图像伪造定位中的泛化能力并指导模型设计

GIFTBench多轴基准揭示跨源迁移不对称等泛化问题,并指导设计出ForenScope框架。

04:00
arXiv cs.CV

Cog-VADU:面向视频异常检测与理解的免训练认知推理框架

提出免训练框架Cog-VADU,将视频异常检测重构为序列认知推理,结合跨模态重排序,提升零样本可解释性。

04:00
arXiv cs.CV

GenCOPE:面向机器人抓取的合成到真实泛化类别级物体位姿估计

仅用合成数据训练,借助2D-3D语义一致性与跨模态融合,实现轻量高效且可泛化至真实的类别级物体位姿估计。

04:00
arXiv cs.CV

OneStreamer:统一流式视频交互中的感知、记忆与主动响应

OneStreamer统一流式视频感知、记忆与主动响应,构建百万级数据,4B模型在八项基准领先。

04:00
arXiv cs.CV

VETO:面向视觉语言模型的视频高效令牌优化

VETO为训练可选插件,以帧内/帧间双轴令牌压缩加速长视频VLM,最高提速45%,精度保持或提升。

2026年10月1日
04:00
arXiv cs.CV

评估多任务形态学概念学习在3D CT肺结节恶性评估中的作用

基于LIDC-IDRI数据比较单任务与多任务3D CNN,发现联合学习毛刺、分叶等形态特征未明显提升恶性风险分类,类别失衡与标注结构是关键。

04:00
arXiv cs.CV

GaugeVLM:以可测量的几何干预结构化空间监督

通过三维场景可控干预生成关联观测,将测量误差转为偏好边际,提升视觉语言模型空间推理与跨域泛化。

04:00
arXiv cs.CV

是组合,而非对话:VLM 丢失的是场景,而非线索

VLM 需正确组合呈现视觉证据;场景碎片化损害使用与定位,仅有充分证据不够。

04:00
arXiv cs.CV

拨动心弦!模态动态字体

提出模态动态字体:用字形固有振动模态驱动平滑动画,冻结视频扩散模型仅调幅相,形状运动解耦,优于基线。

04:00
arXiv cs.CV

Masked Swingers:利用数据增强推动自监督学习中的自编码器发展

提出掩码交换者:双增强分别掩码编码,交换CLS后解码,学视角无关表示,显著优于MAE。

04:00
arXiv cs.CV

ExploreNet:在扩散GRPO中学习何处探索

提出ExploreNet自适应探索扩散GRPO各潜变量噪声,生成质量提升14%,人类偏好胜率67.2%。

04:00
arXiv cs.CV

改写感知代价甚微:视觉语言模型在 ε ≤ 4/255 下的定向语义替换

白盒定向语义替换在ε≤4/255内即可改写VLM感知,将源语义完全替换为目标语义,并出现语义融合。

04:00
arXiv cs.CV

学习语义修补以实现可动画的高斯头部化身

提出SInGA,在UV空间做语义修补补全单图未观测面部区域,回归高斯属性,无需逐身份优化即可动画。

04:00
arXiv cs.CV

用于视觉语言模型少样本分布外适应的归纳视觉逻辑

免训练归纳视觉逻辑:借VLM残存描述能力构建类别特征词典,实现远域分布外可解释分类。

04:00
arXiv cs.CV

TrackFish3D:基于多视角视频的鱼群自监督三维跟踪

TrackFish3D利用多视角几何自监督实现鱼群三维跟踪,无需身份标注,3D MOTA达95.8%,并可泛化至鸟类。

04:00
arXiv cs.CV

PhyProbe:重新思考生成视频中的物理一致性评估

PhyProbe 用冻结时空编码器加轻量评分头,融合排序、回归与校准,评估生成视频物理一致性;多数基准领先,与人类判断高度一致,偏好评估也有竞争力。

04:00
arXiv cs.CV

MSU 团队 GenText-Forensics 2026 挑战赛技术报告

提出分解式思维链流水线,结合篡改检测器与双视觉语言模型,获挑战赛第三名。

04:00
arXiv cs.CV

超越层级:统一多模态模型的位置分辨梯度冲突与位置感知调制

发现生成-理解梯度冲突随视觉token位置变化,提出位置感知调制,仅在高冲突位置去除反对齐梯度,提升统一多模态模型性能。

04:00
arXiv cs.CV

VidHarness:面向低成本长视频理解的可进化智能体框架

VidHarness以MCTS进化智能体框架,借多保真验证与混合路由降本,在多项长视频理解基准上刷新SOTA。

04:00
arXiv cs.CV

MOBA-VL:面向实时MOBA解说的赛事事件定位多轮强化学习

MOBA-VL以遥测定位事件、多轮强化学习训练9B模型,实时解说总分领先,事件召回率升至42.1%。

04:00
arXiv cs.CV

LoopVL:循环视觉智能

LoopVL将循环Transformer扩展至视觉语言模型,共享模块迭代更新多模态状态,性能超越更大模型并现视觉顿悟。

04:00
arXiv cs.CV

可听世界模型:面向3D世界的空间感知声音生成

免训练框架将声音融入3D世界:语义分层定位声源并锚定几何,渲染随听者移动的空间音频,空间一致性更强。

04:00
arXiv cs.CV

PAMI:面向文本到人体-物体交互生成的部位锚定运动框架

PAMI用身体部位锚点投票定位物体运动,粗到细生成并细化接触几何,接触召回率较此前最佳提升14.5%。

04:00
arXiv cs.CV

面向任务特定视觉感知的合成数据策划

核心不是生成更多,而是生成什么:按任务设计场景、外观与标注;程序化渲染、物理仿真与生成式AI各有所长,须与真实数据互补。

04:00
arXiv cs.CV

基于视觉语言模型街景描述的行人路径感知安全估计

以视觉语言模型街景描述作可解释中介,估算感知安全并规划行人路线;实地验证相关性有限,基准提升未带来现场增益。