10841 条条目 · 106 个活跃源
2026年9月14日
04:00
arXiv cs.CV

通过效价-唤醒度锚定的强化学习平衡图像生成中的情感对齐与语义一致性

提出VA锚定Flow-GRPO,用CLIP-VA奖励与中性语义锚,平衡情感对齐与语义一致。

04:00
arXiv cs.CV

超越精度:面向可靠生物医学图像分割的不确定性引导边界细化

提出RABR-Net,以不确定性引导门控残差细化边界,显著提升边界Dice与HD95,增强分割可靠性。

04:00
arXiv cs.CV

MGAvatar:面向头部化身几何与外观建模的网格绑定高斯

提出网格-高斯混合表示,以顶点绑定与面绑定两种模式分阶段建模头部几何与外观,实现高保真头像渲染。

04:00
arXiv cs.CV

标签噪声下的手语识别学习:面向孤立词与连续场景的噪声鲁棒损失研究

手语识别标签噪声下,SCE/GCE在孤立词任务优于CE但稳定性差;连续任务无增益,辅助权重效应混淆。

04:00
arXiv cs.CV

VideoTok4D:面向紧凑世界表示的4D感知视频分词器

提出4D感知视频分词器VideoTok4D,通过时空解耦与轨迹动态注意力,实现紧凑4D表示,存储大减且生成高效。

04:00
arXiv cs.CV

基于潜在布朗桥扩散的3D CT到PET转换

提出潜在布朗桥扩散两阶段3D CT到PET转换,VAE对比学习对齐,提升PET保真度与病灶代谢保留。

04:00
arXiv cs.CV

TileNet:面向平屋顶自主无人机系统巡检的基于瓦片的CNN-SVM架构

提出瓦片式轻量CNN-SVM架构,无人机双高度实时巡检平屋顶,准确率达94.4%,优于GoogLeNet与AlexNet。

04:00
arXiv cs.CV

UniPart:面向具身交互的零样本语言驱动3D部件分割

UniPart以CLIP文本驱动3D Transformer,实现零样本开放词汇部件分割与真实抓取。

04:00
arXiv cs.CV

基于CNN-DNN架构的并行训练加速诊断模型开发

CNN-DNN并行训练提升新冠CT诊断效率,3D CNN训练时间最多缩短31倍,兼顾性能与速度。

04:00
arXiv cs.CV

输入分辨率至关重要:实时目标检测延迟

延迟建模为预处理、推理、后处理分布卷积,参数随分辨率变化;实验表明分辨率感知参数化拟合更优。

04:00
arXiv cs.CV

快速且忠实:面向逆问题的基于原理的条件流匹配

提出条件速度场原则性参数化,显式数据一致性,端到端训练,达最优且少50倍计算,可调失真-感知。

04:00
arXiv cs.CV

DementiaCare-Bench:一个经模态验证的视频基准

构建痴呆护理视频基准,发现视觉语言模型对需时序视频的护理判断近随机,LoRA微调可修复。

04:00
arXiv cs.CV

SV-Cine:基于生成式数据增强的诊断条件化单心室生理分割

提出SV-Cine,结合生成式数据增强与诊断条件FiLM适配基础模型,提升单心室生理MRI分割。

04:00
arXiv cs.CV

面向无监督文本行人搜索的生成式检索

提出生成-检索两阶段框架GTR+,分层生成描述并结合置信度加权,实现无监督文本行人搜索。

04:00
arXiv cs.CV

基于智能体规划与图引导优化的物理感知视频生成

PhysPlan免训练,用VLM智能体规划与物体级梯度路由,锁定背景,提升视频物理合理性。

04:00
arXiv cs.CV

像素可解码性不是压缩信号:对视觉 KV 缓存驱逐重要性代理的因果评估

视觉KV缓存中像素可解码量任务无关,注意力仅弱相关;像素可解码性无法有效指导KV驱逐压缩。

04:00
arXiv cs.CV

MLLM 听到了什么?面向音频 MLLM 可解释性的 Token 级时频谱定位

STAG:首个音频MLLM的token级时频谱事后定位框架,融合投影与频谱遮挡,定位精准。

04:00
arXiv cs.CV

面向标签高效跨模态子区域迁移的统一 CT 与 MRI 胰腺分割

域对抗学习统一CT/MRI胰腺分割,全胰Dice达87.31%,仅凭MRI标注即可迁移至胰头体尾子区域。

04:00
arXiv cs.CV

自动驾驶中弱势道路使用者的场景无关关键性评估与预测

提出面向弱势道路使用者的场景无关关键性评估与预测框架,行人关键性分类提升50%,F1达0.96。

04:00
arXiv cs.CV

自适应AI:边缘智能视觉系统上的高能效多出口TinyML

GAP9上多出口TinyML实现计算量降41%、时延降29%、能耗降24%,精度仅损约1%。

04:00
arXiv cs.CV

未标注的回声:面向蝙蝠鸣声识别的伪标签与属级感知平滑

伪标签把海量未标注蝙蝠录音转化为有效监督,媲美全监督,迁移至南非野外音频,并提出属级感知平滑。

04:00
arXiv cs.CV

MoPA:通过子系统特定感知对齐的协调移动操作

MoPA 以双感知流对齐移动与操作的感知,并用耦合流匹配联合生成动作,仿真与真实任务均达最优。

04:00
arXiv cs.CV

动作识别中3D-CNN的标签引导知识蒸馏

提出标签引导知识蒸馏LGKD,以样本级与类别级蒸馏用标签指导3D-CNN学生特征学习,提升识别性能。

04:00
arXiv cs.CV

何时该开口:主动式车载智能体应在何时发言?

41人VR乘车实验比较事件触发与情境敏感沟通策略:后者提升沟通恰当性、大幅减少打扰,信任无差异。

04:00
arXiv cs.CV

IMPLY:世界模型推演的物理锚定一致性

IMPLY通过反演模拟器提取推演隐含物理,并以校准推动为锚评估一致性;它能识破自洽却忽略物体的世界模型,择优逼近最优。

04:00
arXiv cs.CV

AnchorVLN:面向开放词汇导航的几何锚定视觉-语言接地推理

AnchorVLN:VLM提语义、几何定度量,开放词汇导航指令跟随64.4%,定位误差降至2.48米。

04:00
arXiv cs.CV

Lumina-OmniLV: A Unified Multimodal Framework for General Low-Level Vision

04:00
arXiv cs.CV

SNAP3D:从单张图像生成物理可装配的3D部件

物理引导框架从单图生成可装配部件级3D资产:消除穿插、添加参数化连接件,经仿真优化与3D打印验证。

04:00
arXiv cs.CV

R²M:面向鲁棒且可泛化深度伪造检测的真实感知残差模型融合

提出免训练R²M,分解任务向量为共享与生成器残差,离线谱构建、在线路由,跨域未见场景鲁棒可解释。

04:00
arXiv cs.CV

TestDG:面向持续测试时自适应的测试时域泛化

TestDG在线学习域不变特征并管理历史域,提升CTTA对未来域的泛化,四项基准达SOTA。

04:00
arXiv cs.CV

SUCCESS-GS: Survey of Compactness and Compression for Efficient Static and Dynamic Gaussian Splatting

04:00
arXiv cs.CV

UniLayDiff:面向内容感知布局生成的统一扩散Transformer

统一扩散Transformer,首次以单模型端到端处理多种内容感知布局生成任务,达SOTA。

04:00
arXiv cs.CV

基于弱点靶向后训练的统一文本-图像生成

通过弱点靶向后训练,模型单次推理自主完成文本推理到图像生成,并在多个T2I基准上提升。

04:00
arXiv cs.CV

4D-RaDiff:面向4D雷达点云生成的潜在点扩散模型

提出4D-RaDiff框架,在潜在空间扩散生成4D雷达点云,通过数据增强提升目标检测性能。

04:00
arXiv cs.CV

MARE:基于视觉语言模型的多模态对齐与强化用于可解释深度伪造检测

MARE通过视觉语言模型实现多模态对齐与强化,结合RLHF奖励与伪造解耦模块,提升可解释深度伪造检测的准确性与可靠性。

04:00
arXiv cs.CV

循环动态范围扩展

提出循环动态范围扩展:先学单曝光值扩展,再迭代重建完整HDR,并用记忆回放稳健恢复高光。

04:00
arXiv cs.CV

早期干预:基于VFM的多模态医学图像分类

提出早期干预框架,用参考模态语义令牌引导目标模态嵌入,并设计混合秩LoRA实现高效VFM适配,在三个医学数据集上验证有效。

04:00
arXiv cs.CV

AnyView:在动态场景中合成任意新视角

提出扩散视频生成框架AnyView实现动态视角合成,融合多源监督训练,可从任意相机位姿零样本生成时空一致视频,并推出极端动态场景新基准AnyViewBench。

04:00
arXiv cs.CV

基于多视角视频的稠密动态场景重建与相机位姿估计

提出两阶段多相机优化框架,重建稠密动态场景并估计相机位姿,发布新数据集,性能优且省内存。

04:00
arXiv cs.CV

EventMemAgent:面向在线视频理解的以事件为中心的分层记忆与自适应工具使用

提出EventMemAgent,以分层事件记忆结合智能体强化学习与自适应工具,提升在线视频理解。

04:00
arXiv cs.CV

面向基于RTK-GNSS的自定义自动标注的多车辆数据集:含相机、激光雷达与雷达传感器及扫描3D模型

提出含相机、激光雷达、雷达及扫描3D模型多车数据集,RTK-GNSS提供位姿与运动学参考,可评估遮挡反射。

04:00
arXiv cs.CV

Uni-HOI:学习文本与人-物交互联合分布的统一框架

提出Uni-HOI统一框架,用LLM和VQ-VAE联合建模文本、人体与物体运动,经两阶段训练统一处理多类人-物交互任务。

04:00
arXiv cs.CV

EgoFun3D:基于功能模板从第一人称视频建模可交互物体

提出EgoFun3D,用功能模板从第一人称视频建模可交互3D物体,发布517视频数据集与四阶段基准。

04:00
arXiv cs.CV

面向半导体IC封装的视觉Transformer架构-令牌-位宽多轴联合优化

联合优化ViT架构、令牌与位宽,用于半导体IC封装检测,吞吐、参数、计算与能耗均改善超10倍且保精度。

04:00
arXiv cs.CV

异常偏好图像生成

提出异常偏好优化,将异常生成转为偏好学习,无需标注,用时间感知容量分配与分层采样兼顾真实性与多样性。

04:00
arXiv cs.CV

DRDN:面向从头训练ViT类增量学习的解耦表征动态网络

DRDN以MIM保持共享表征、逐层任务token扩展减干扰,提升从头ViT类增量学习且无推理开销。

04:00
arXiv cs.CV

当低字符错误率不再足够:乌拉圭历史文献中视觉语言OCR系统的幻觉分析

视觉语言OCR在乌拉圭历史档案上CER虽低,却有拼写规范化、虚假生成与语义替换等幻觉,评估需超越字符精度。

04:00
arXiv cs.CV

补上缺失的第一步:视觉语言模型能否标准化原始异构医疗数据?

医学VLM评测忽视原始异构数据标准化;本文提出MDS-Bench,最佳模型端到端成功率仅48.6%。

04:00
arXiv cs.CV

RoMu4o:面向果园作业的机器人操作单元,实现近端高光谱叶片传感自动化

RoMu4o果园机器人集成机械臂与视觉,自动抓取叶片并高光谱感知,室内成功率95%、果园70%。

04:00
arXiv cs.CV

NSL-SLAM:面向实用SLAM与重建的高保真神经结构光深度

提出NSL-SLAM,融合单目先验提升结构光深度,构建深度中心SLAM,实现高精度跟踪、重建与实时鲁棒性。