11301 条条目 · 106 个活跃源
2026年6月29日
04:00
arXiv cs.CV

文本照明:面向语言引导医学图像分割的空间对比Retinex学习

提出文本照明Retinex网络,以文本嵌入调制特征,正负照明图对齐前景背景,多尺度监督,达医学分割SOTA。

04:00
arXiv cs.CV

CSD:内容感知的投机解码以实现高效图像生成

提出内容感知投机解码CSD,通过熵概率松弛与最优重采样动态调整接受率,加速图像生成并提升质量。

04:00
arXiv cs.CV

ScaLe-INR:尺度与学习隐式神经表示

ScaLe-INR通过多分支架构和方向边缘引导损失消除频谱串扰,在图像、音频、3D重建中显著超越现有方法。

04:00
arXiv cs.CV

可控的组织病理学图像合成:无需训练的结构初始化和纹理调制

提出CHIS框架,通过结构初始化和纹理调制,让无标注预训练扩散模型生成符合先验掩膜的高保真组织病理图像。

04:00
arXiv cs.CV

面向O(2)离散子群等变的视觉Transformer统一框架

提出O(2)离散子群等变ViT统一框架,理论保证子群嵌入与表达能力,构建D6模型,实验表明等变提升识别准确率。

04:00
arXiv cs.CV

OrthoTryOn:基于几何正交化的无冲突统一时尚生成

OrthoTryOn通过正交子空间投影与Fisher引导负梯度,消除任务间冲突,实现统一时尚生成并超越独立模型。

04:00
arXiv cs.CV

带有遮挡恢复的局部和全局人体运动长期预测

提出非自回归时空注意力Transformer,实现局部和全局人体运动预测,并具备遮挡恢复能力。

04:00
arXiv cs.CV

A Multi-Attribute Latent Space for Visual Analysis of Watches

04:00
arXiv cs.CV

去而复返:面向多曝光融合的灵活帧数Transformer

提出FreeMEF,首个灵活帧数Transformer,通过递归状态空间和全局特征引导,实现任意数量曝光帧的无缝融合。

04:00
arXiv cs.CV

课程引导的变化检测训练:迈向精准的冰塔崩塌监测

提出课程学习框架,利用太阳角差距和结构相似性度量难度渐进训练,提升变化检测鲁棒性,优于均匀采样。

04:00
arXiv cs.CV

ReScene:多视图捕获下的结构化室内场景重建

ReScene通过多视图几何与关系感知组装,实现物理一致的高质量场景重建,精度提升且速度比先前方法快10倍。

04:00
arXiv cs.CV

使用Token激活图理解多模态大语言模型如何描述艺术品

TAM揭示MLLM描述艺术品的视觉依据因语义类别而异,作品识别准确率有差异,并与SAM比较。

04:00
arXiv cs.CV

指挥世界:基于组合式人-摄像机控制的快速自回归视频生成

提出快速自回归框架,解耦人运动与摄像机控制,以快慢记忆训练实现长程稳定、高视觉质量的视频生成。

04:00
arXiv cs.CV

基于蒙特卡洛树搜索的潜在视觉扩散推理

提出LVDR框架,用MCTS建模可视化推理,提升技能评估准确性与可解释性。

04:00
arXiv cs.CV

HumanMoveVQA:视频多模态大模型能否推理人类运动?

提出HumanMoveVQA基准,评估视频模型对全局轨迹和方向推理,发现能力差距,但微调可显著提升。

04:00
arXiv cs.CV

EMOSH:用于人体动画的表现性运动与形状解耦

EMOSH通过显式解耦形状与姿态,实现高保真可控人体视频生成,解决形状泄露并增强表情手势控制。

04:00
arXiv cs.CV

TempAct: 通过规划器-执行器强化学习提升自回归视频生成的时间合理性

TempAct采用规划器-执行器强化学习,通过分层探索与奖励机制,提升自回归视频生成的时间一致性与质量。

04:00
arXiv cs.CV

AirGroundBench:异构多视角具身协作下多模态大模型的空间智能探测

提出AirGroundBench,评估异构空-地多视角空间智能,发现模型跨视角对齐与推理薄弱,双视角虽提升但距人类仍有差距。

04:00
arXiv cs.CV

RPM-Distill: 生理引导的自适应跨模态蒸馏用于鲁棒的远程生理测量

利用雷达辅助视频,通过频谱知识蒸馏提升远程生理测量的鲁棒性,在挑战条件下MAE降低81%,相关性提升21%。

04:00
arXiv cs.CV

TextDS:分布偏移下场景文本检测的参数高效表示对齐

TextDS提出参数高效框架,含双编码器与逐步LoRA,仅4.9M参数实现分布偏移下鲁棒场景文本检测。

04:00
arXiv cs.CV

利用测试时自适应学习拓扑感知的异常分割表示

提出TopoTTA框架,将拓扑持久同调融入测试时自适应,增强异常分割结构一致性,在多个基准上平均F1提升15%。

04:00
arXiv cs.CV

通过去噪器响应的谱耦合进行扩散模型归因

利用去噪器谱几何特征提取稳定签名,SDS方法以99.9%准确率非侵入式归因扩散模型。

04:00
arXiv cs.CV

基于级联扩散先验和UV空间可微着色的单目虚拟人像重建

用级联扩散先验和UV空间可微着色,从单张图高效重建4K可重光照虚拟人像。

04:00
arXiv cs.CV

Cross-view Multimodal Vision-Based Assessment Framework for Traditional Chinese Medicine Rehabilitation Training

04:00
arXiv cs.CV

EchoSonar-R: 一种支持多视角推理的超声心动图疾病分类与报告生成模型

EchoSonar-R通过多视角推理与强化学习两阶段训练,显著提升超声心动图疾病分类与报告生成的准确性和可解释性。

04:00
arXiv cs.CV

RSICCLLM:一种用于遥感图像变化描述的多模态大语言模型

提出RSICCLLM后训练框架,以差异感知微调和双负偏好优化,7B参数超越大规模模型。

04:00
arXiv cs.CV

尺度空间度量的稳定性研究

研究高斯尺度空间度量的稳定性,量化对几何变形和噪声的鲁棒性,引入旋转不变版本并给出高效算法。

04:00
arXiv cs.CV

增强共封装光学硅光子安全保证的硬件指纹技术

在硅光子芯片填充区嵌入光子晶体,产生独特光学签名,实现低成本高分辨率硬件指纹认证。

04:00
arXiv cs.CV

DIM-WAM:具有多样化历史事件记忆的世界-动作建模

提出记忆增强模型,融合多尺度历史与任务进度,长程任务成功率从28.4%提升至69.8%。

04:00
arXiv cs.CV

感知准则:将多模态评估校准至人类感知

提出感知准则框架,通过双流准则与门控评分揭示模型脆弱性,验证严格感知保真度是可靠生成的前提。

04:00
arXiv cs.CV

翻译作为桥接动作:将操作技能从人类迁移到机器人

提出桥接动作表示(相对手腕平移),从人类数据迁移技能到双臂机器人,比6DoF更有效且可扩展。

04:00
arXiv cs.CV

StructSplat:基于未标定稀疏视图的可泛化三维高斯泼溅

提出结构化表示与像素对齐特征注入,无需相机参数即可泛化重建三维高斯泼溅,性能大幅领先。

04:00
arXiv cs.CV

PIAA-ZWFS的可微设计:一种逼近基本极限的灵活波前传感器

提出PIAA-ZWFS波前传感器,采用可微设计逼近基本极限,性能优于传统ZWFS,且不牺牲动态范围。

04:00
arXiv cs.CV

基于生物物理皮肤反演的RGB光谱次表面散射

本文提出光谱光学反演,从RGB反照率预测皮肤全光谱散射参数,用于路径追踪渲染。

04:00
arXiv cs.CV

从损坏观测中训练清洁扩散模型的期望最大化算法

EMDiffusion通过期望最大化迭代重建与优化,从损坏观测训练扩散模型,在成像逆任务上达新SOTA。

04:00
arXiv cs.CV

跨越极端复杂度和质量尺度的增强型神经视频表示压缩

提出NVRC++编码器,以轻量INR多特征网格实现跨复杂度稳定性能,解码速度提升7.6倍。

04:00
arXiv cs.CV

MVGS:多视图正则化高斯泼溅用于新视角合成

提出多视图训练范式,结合交叉内参引导与稠密化策略,提升3D高斯泼溅的重构精度与视角合成质量。

04:00
arXiv cs.CV

基于Gershgorin盘对齐的图展开与采样用于过渡视频关键帧选择

通过Gershgorin盘对齐快速图采样,线性时间选出关键帧,性能相当或更优,复杂度显著降低。

04:00
arXiv cs.CV

VLM引导的视觉地点识别用于行星尺度地理定位

提出VLM引导混合框架,结合检索与重排序,在街道和城市级别分别提升4.51%和13.52%,实现可扩展、鲁棒的高精度地理定位。

04:00
arXiv cs.CV

细粒度行为与车道约束引导的轨迹预测方法

提出BLNet双流架构,通过并行注意力融合行为意图与车道约束,提升轨迹预测精度。

04:00
arXiv cs.CV

基于图像的机器人地理定位:黑盒视觉语言模型是否已就绪?

黑盒VLM零样本地理定位:粗定位有效,细粒度定位因现实变化而不可靠。

04:00
arXiv cs.CV

Web2Grasp:从手-物交互的网络图像中学习功能性抓取

利用网络手-物交互图像,通过3D重建与交互模型学习功能性抓取,仿真和真实实验成功率分别达75.8%和77.5%。

04:00
arXiv cs.CV

SurgXBench:用于手术的可解释视觉-语言模型基准

评估手术视觉语言模型零样本性能,发现其依赖弱上下文而非临床证据,需加强视觉推理监督。

04:00
arXiv cs.CV

StableMotion: 基于扩散先验的单步运动估计

StableMotion利用扩散先验实现单步运动估计,在图像矫正任务中达到SOTA,速度提升超100倍。

04:00
arXiv cs.CV

DIVER:强化扩散打破端到端自动驾驶中的模仿瓶颈

DIVER用强化学习引导扩散生成多样轨迹,打破模仿学习瓶颈,提升端到端自动驾驶泛化能力。

04:00
arXiv cs.CV

SRMA-Mamba: 面向MRI体积中病理性肝脏分割的空间反向Mamba注意力网络

提出SRMA-Mamba网络,利用空间解剖Mamba和反向注意力机制,实现MRI体积病理性肝脏高效分割,超越现有方法。

04:00
arXiv cs.CV

QuantV2X: 面向协同感知的全量化多智能体系统

QuantV2X首次实现全量化多智能体协同感知,在低比特下精度媲美全精度,延迟降低3.2倍,mAP30提升9.5。

04:00
arXiv cs.CV

让语言约束几何:视觉-语言模型作为3D生成的语义与空间评判器

VLM3D利用视觉-语言模型的双查询批评信号,优化语义对齐和空间一致性,显著提升3D生成质量。

04:00
arXiv cs.CV

基于高级模态条件与交互的文本到有声视频生成控制

提出HVGC解耦字幕框架和BridgeDiT双塔扩散变换器,实现跨模态同步,达到SOTA性能。

04:00
arXiv cs.CV

Training-free Uncertainty Guidance for Complex Visual Tasks with MLLMs