10712 条条目 · 106 个活跃源
2026年10月1日
04:00
arXiv cs.CV

Aperture:面向遥感的免训练多尺度概念瓶颈

APERTURE:免训练多尺度概念瓶颈,融合四叉树路由与MLLM评分,在遥感SiFC上超越免训练和监督基线。

04:00
arXiv cs.CV

GazeFlow:从人类注视行为到生成式第一人称注视预测

GazeFlow将注视建模为任务与视觉显著性条件下的联合分布,用条件流匹配生成轨迹,性能达SOTA且更符合人类注视动态。

04:00
arXiv cs.CV

ThinkV2V:释放多模态大语言模型推理能力,实现指令引导的视频编辑

ThinkV2V让MLLM先推理再生成视频,结合渐进课程训练与推理时思考扩展,5B模型超越10B基线。

04:00
arXiv cs.CV

LongTake: Learning to Sustain Dynamics in Long-Horizon Video Generation

04:00
arXiv cs.CV

多维观察者模型与人类图像质量评估的感知维度

提出多维观察者模型,以潜在感知空间和噪声比较建模人类图像质量判断;发现其极低维,低层与高层结构不同。

04:00
arXiv cs.CV

通过可学习展平实现向多样骨架的运动重定向

提出可学习图展平的Transformer自编码器,无需配对数据,零样本重定向误差降低43-47%。

04:00
arXiv cs.CV

细节与背景:面向蕈样肉芽肿检测的双尺度机器学习框架

提出双尺度CNN与临床特征融合框架,检测蕈样肉芽肿,图像准确率83.58%、敏感性89.13%。

04:00
arXiv cs.CV

在不忘却中复原:基于参数空间积分梯度的滤波器级持续图像复原

提出RwF框架,用参数空间积分梯度定位退化关键滤波器,以低秩变换生成任务滤波器,避免遗忘,参数少十倍。

04:00
arXiv cs.CV

PixelUMM:无编码器的统一图像与视频理解与生成

提出PixelUMM,无编码器在像素空间统一图像与视频理解与生成,采用MoT与流匹配,性能有竞争力。

04:00
arXiv cs.CV

StereoGaussians:基于立体图像的前馈式三维高斯泼溅

从标定立体图像对前馈预测3DGS,复用冻结立体网络特征,以视差锚定几何并扩展容量,实验优于基线。

04:00
arXiv cs.CV

Exo2EgoHOI:手-物交互感知的第三人称到第一人称视频生成

提出手物交互感知框架,融合4D HOI先验与门控跨注意力,实现外视到第一视角生成,物体一致性提升。

04:00
arXiv cs.CV

STEPS:基于扩散与对比式风格编码的保风格场景文本编辑

提出STEPS扩散模型,借助独立风格编码与多语义条件,高质量替换图像文本并保留原风格,优于现有方法。

04:00
arXiv cs.CV

十年之后:以智能体训练数据将阴影去除带入真实世界

针对配对数据十年停滞的困境,提出离线智能体工作流,构建含17138个三元组的AgenticShadow数据集,色差降低50.5%,跨域LAB RMSE降低19.7%–37.5%。

04:00
arXiv cs.CV

EPIC:极线一致的360°沉浸式立体视频生成

提出零样本管线,将视频扩散模型扩展为4K立体360°视频,并以极线感知匹配度量作偏好信号优化,实现沉浸式立体生成。

04:00
arXiv cs.CV

具有语言记忆的视觉-语言-动作自动驾驶智能体

提出AD-Memo,用语言记忆扩展思维链记录关键物体并作为后续输入,经SFT与半闭环强化学习训练,提升驾驶与问答。

04:00
arXiv cs.CV

HIGS:用于几何与语义联合场景理解的分层隐式网格

提出分层隐式神经场,多分辨率子图统一支持几何与语义,含视觉语言特征,实现高效可扩展重建与开放词汇定位。

04:00
arXiv cs.CV

基于多阶段特征对齐的模板-搜索域自适应跨模态目标跟踪

提出模板-搜索域自适应框架,以多阶段特征对齐缩小模态差异,跨模态跟踪性能优于现有方法。

04:00
arXiv cs.CV

ReGain:在合成图像个性化中恢复主体保真度

合成图像个性化因无分类器引导膨胀而损失主体保真度,作者提出免训练采样校正法ReGain,按频段缩放引导。

04:00
arXiv cs.CV

水景的欧拉运动重建

单段非循环二维视频重建可循环四维水景,欧拉运动场驱动高斯泼溅并加残差,实现逼真新视角动画。

04:00
arXiv cs.CV

揭示运动对电影运镜轨迹的价值

提出用方向与速度表示相机轨迹,提升文本对齐与生成,并提出 CineGEN 与 CineScript 数据集。

04:00
arXiv cs.CV

事件驱动刷新与复现记忆:减少指代视频目标分割中的陈旧定位

提出EDRRM,仅在稳定变化点刷新模型并用循环记忆召回锚帧,减少陈旧定位与误报,提升精度效率权衡。

04:00
arXiv cs.CV

SCALE:基于嵌入空间一致性标注的合成校准

病理模型在低一致性病例上校准更差;提出嵌入插值合成一致性校准,无需多标注者即可改善校准且不损区分。

04:00
arXiv cs.CV

Matisse:面向主动三维重建的证据空间推理

Matisse 为免训练框架,用生成式三维模型的证据不确定性统一主动重建与关键帧选取,提升精度与速度。

04:00
arXiv cs.CV

绝不走捷径:面向视频生成中途流式提示切换的状态锚定过渡

SEGUE用免训练规划器生成过渡提示,配合SPANDMD训练,使中途提示切换的状态过渡更真实。

04:00
arXiv cs.CV

软空间推理

提出软空间推理框架,混合词元嵌入成软状态,并由AdaptSoft自适应调节软化程度,缓解过早离散化。

04:00
arXiv cs.CV

SpatialCORE:大型视觉语言模型中置信度感知的定位式空间推理

SpatialCORE将模型对生成定位的置信度转化为空间推理奖励,配合答案门控,在多项基准上达开源最优。

04:00
arXiv cs.CV

于此聆听立体声世界:学习动态空间对应以实现沉浸式音视频联合生成

提出StereoBind,以运动轨迹绑定视觉运动与立体声生成,实现动态空间对应,并构建数据集与基准,显著提升立体声空间一致性。

04:00
arXiv cs.CV

面向参考引导伪装目标检测的共识感知多源融合

提出共识感知多源融合框架,利用参考条件双骨干融合与跨参考共识聚合,提升参考引导伪装目标检测效果。

04:00
arXiv cs.CV

困难区域监督:荣登 Waymo 开放数据集 2D 视频全景分割排行榜榜首

提出困难区域监督改进DVIS++,结合测试时集成与跨相机链接,在Waymo视频全景分割挑战赛三项指标第一。

04:00
arXiv cs.CV

基于学习排序与验证的智能体式相对相机位姿估计

提出PoseAgent智能体框架,用学习排序与验证调度估计器,相对相机位姿估计AUC@5最高提升4.2%。

04:00
arXiv cs.CV

蒸馏视觉证据,而非仅答案:面向视觉语言模型的跨世界同策略蒸馏

提出CW-OPD,构造关键证据不同的双视觉世界,蒸馏教师信念转变,显式监督学生对视觉证据的依赖。

04:00
arXiv cs.CV

FLOW:面向泛化远程生理测量的特征级最优扭曲

提出最优传输驱动的FLOW框架,融合时序细化与原型跨时序对齐,实现域泛化rPPG,跨域性能达SOTA。

04:00
arXiv cs.CV

CRAFT:医学视觉语言模型中的因果责任与失效追踪

CRAFT定位医学视觉语言模型中文本压过图像与证据不足仍作答的因果注意力头,干预可纠正且无需重训。

04:00
arXiv cs.CV

未来视频生成比观测视频更契合人类视觉皮层

未来视频生成表征比观测视频重建更契合人类视觉皮层,尤其高阶皮层;人类偏好放大高对齐层贡献的视频。

04:00
arXiv cs.CV

DCM-SAM:面向NPU部署的增材制造缺陷分割的缺陷条件化LoRA专家混合模型

提出缺陷条件LoRA专家混合DCM-SAM,冻结SAM仅用合成切片训练;ViT-B在真实NIST孔隙IoU达64.2%,并可在Hexagon NPU上FP16部署。

04:00
arXiv cs.CV

DecoMoE:解耦视觉传播与专家计算,实现高效多模态 MoE 推理

DecoMoE解耦视觉传播与专家计算,压缩多模态MoE推理,保持97.91%性能并加速1.69倍。

04:00
arXiv cs.CV

FrameMorrow:面向长时程视频生成的未来引导帧选择与前瞻Token

FrameMorrow预测未来信息需求的前瞻token,据此筛选历史帧,可插拔集成,提升长时程视频生成一致性。

04:00
arXiv cs.CV

解耦球面推理与密集预测的360°深度估计

提出斐波那契球面图与球面上下文调制,解耦球面推理与ERP密集预测,提升360°深度估计。

04:00
arXiv cs.CV

AdaOcc:面向具身任务的自适应三维占用预测

提出AdaOcc点式自适应3D占用预测,支持多传感输入与算力可调,用包含损失提升几何建模,在Occ-ScanNet上达最优。

04:00
arXiv cs.CV

MEMO:面向流式视频理解的多层级实体感知记忆

提出免训练即插即用的MEMO,以多层级实体感知结构化记忆建模流式视频,保留细粒度证据,提升多项基准。

04:00
arXiv cs.CV

图像分割中条件独立假设的松弛

RankSEG因条件独立假设忽略标签相关性;提出空间局部依赖建模,结合矩近似与不动点优化,O(d log d),低对比小目标显著提升。

04:00
arXiv cs.CV

超越空间域监督:面向多模态图像融合的关系约束空间

提出关系约束监督范式,将融合监督从空间域移至学习关系空间,以预训练特征适配器建模共享、主导与协调关系。

04:00
arXiv cs.CV

TED:面向提示式异常定位的文本轴证据分解

TED无需目标域训练,以文本轴证据分解区分缺陷与困难正常区,提升CLIP异常定位像素级可靠性。

04:00
arXiv cs.CV

PARK:面向视频扩散Transformer稀疏注意力的精确块检索

PARK免训练,保留独立查询、按当前查询聚类键,纠正块检索偏差,兼顾视频生成质量与推理加速。

04:00
arXiv cs.CV

通过错误发现控制的视觉数据划分缓解大型视觉语言模型中的物体幻觉

提出免训练框架CORAL,利用不确定性感知视觉数据划分与镜像统计控制图像级错误发现率,有效抑制LVLM物体幻觉。

04:00
arXiv cs.CV

MeshOctave 通过级联分辨率过渡生成网格

提出MeshOctave,用二进网格分辨率与拆分重连离散扩散并行生成网格,支持自适应细化,几何与拓扑更优。

04:00
arXiv cs.CV

当积分遇见分解:面向多模态图像融合的信号级自监督特征分解范式

提出积分驱动的信号级自监督特征分解范式,将2D图像级监督转为1D信号优化,在多模态图像融合中达SOTA。

04:00
arXiv cs.CV

面向视频推理的帧差分同策略自蒸馏

FD-OPSD用token级自蒸馏把稠密帧视觉证据迁移给稀疏帧策略,在多个视频推理基准上超越GRPO等基线。

04:00
arXiv cs.CV

文本到图像模型的持久性水印

提出对比式水印目标,使水印模型对触发输入行为异于原模型,可抗下游改动与去水印攻击,检出率近100%。

04:00
arXiv cs.CV

从图像解读到临床推理:基于因果强化学习的上游医师上下文感知多模态学习

提出因果强化学习框架,融合胸片与病史预测MACE,三队列AUROC达0.720/0.760/0.845,提升推理质量。