11271 条条目 · 106 个活跃源
2026年7月3日
04:00
arXiv cs.CV

EquiSteer: 交叉注意力引导实现更公平的文本到图像生成

EquiSteer通过推理时引导交叉注意力,将性别偏见降低87%,无需训练且保持图像质量。

04:00
arXiv cs.CV

SuperFlex:可变形超二次曲面实现点云分解

SuperFlex通过新损失函数、弯曲锥形变形和基于高质量分解的训练,显著提升点云重建精度与鲁棒性。

04:00
arXiv cs.CV

GenAU:基于语言引导的视觉-语言模型工业异常理解

GenAU统一检测、分割、多类型分析和缺陷描述,在跨数据集上实现领先的图像级检测性能。

04:00
arXiv cs.CV

CPDDNet:彩色偏振去噪与去马赛克网络

提出联合去噪与去马赛克网络,通过特征融合提升图像质量与偏振精度。

04:00
arXiv cs.CV

GeoSearcher:锚点引导渐进推理与过程监督的遥感视觉定位

GeoSearcher通过锚点引导渐进推理,结合过程监督,显著提升遥感小目标定位与复杂查询性能。

04:00
arXiv cs.CV

通过迭代元反射的自主科学发现

DiscoPER框架通过二阶元反思机制自主发现科学规律,在生态基准中恢复8/9已知模式,假设支持率72.7%。

04:00
arXiv cs.CV

MoHallBench:视频大语言模型中的运动幻觉基准

MoHallBench基准评估视频大语言模型的运动幻觉,含1.1万视频和4万问答,发现顺序推理幻觉最严重。

04:00
arXiv cs.CV

SD-RouteFusion:基于SD地图路线条件的主车轨迹预测

提出融合摄像头、运动学与SD地图路线的端到端主车轨迹预测方法,8秒预测ADE降低16.9%,并开源工具。

04:00
arXiv cs.CV

面向度量无关的轨迹预测

提出度量无关概率训练,将度量优化作为下游任务,引入TraDiE策略,DONUT-NLL在Waymo基准上取得最优。

04:00
arXiv cs.CV

以关系为中心的开词汇3D高斯分割

PairGS通过建模高斯间关系,利用视图贡献和多视图证据构建关系图,实现高效准确的开词汇3D高斯分割,速度提升50倍。

04:00
arXiv cs.CV

Linkify:从接口增强的装配图中学习

Linkify利用接口增强装配图和图注意力网络,实现高精度零件检索,优于传统方法。

04:00
arXiv cs.CV

个性化模型与基础模型的闭环耦合用于MRI实时治疗指导

提出闭环耦合框架,结合个性化预测与基础模型,在MRI引导治疗中实时更新预测,减少剂量误差。

04:00
arXiv cs.CV

《迷魂记》之迷魂记:通过预测性AI替身重建电影理想

仅用2.78%原帧AI重建《迷魂记》,73.1%帧可识别,揭示电影规范压缩于模型,引发真实性疑虑。

04:00
arXiv cs.CV

Ink3D:通过视频生成模型雕琢具有极其复杂纹理的3D资产

利用大规模视频生成模型,解耦几何与纹理合成,生成极复杂且忠实于参考的纹理。

04:00
arXiv cs.CV

感知-推理:解耦感知与推理实现细粒度视觉推理

提出解耦感知与推理的P2R框架及交替强化学习策略,显著提升细粒度视觉推理性能。

04:00
arXiv cs.CV

用于噪声K空间域MRI重建的高维嵌入先验

提出高维K空间嵌入框架,提升扩散模型在噪声MRI重建中的表现,尤擅高噪声场景。

04:00
arXiv cs.CV

呈现差异以校准MLLM生成图像描述的感知可靠性

通过呈现多个MLLM响应差异,盲人用户识别不可靠描述能力提升4.9倍,14/15用户更偏好此方式。

04:00
arXiv cs.CV

属性提示的核哈希用于无监督数据高效跨模态检索

提出APKH方法,利用属性先验和核映射构建紧凑汉明空间,解决数据有限下的过拟合与泛化问题。

04:00
arXiv cs.CV

3D点云世界模型:点云补全实现更精确的动态学习

提出3DPWM,先补全部分点云再学习动作条件动态,实现长时域可靠预测与规划迁移。

04:00
arXiv cs.CV

运动中的世界:基于单目视频的生成式动态高斯重建

提出从单目视频生成动态3D高斯表征的方法,纠正伪影、填补缺失,实现高质量4D重建与泛化。

04:00
arXiv cs.CV

Human-Centric Transferable Tactile Pre-Training for Dexterous Robotic Manipulation

04:00
arXiv cs.CV

ForAug: 通过受控图像组合缓解图像分类中的偏见

ForAug通过分解并重组图像前景与背景,控制对象位置、尺度和背景,打破偏见,在ImageNet上准确率提升最高达6%,分布偏移基准提升19%。

04:00
arXiv cs.CV

生成内容丰富化

提出生成内容丰富化方法,通过图卷积网络和对抗框架丰富场景图,生成语义更丰富、结构连贯的视觉内容。

04:00
arXiv cs.CV

面向机器人规划的结构化4D潜在预测模型

提出结构化4D潜在预测模型,预测3D场景演变,实现强一致性与多视图连贯,在复杂机器人操作中表现优异。

04:00
arXiv cs.CV

一次学习,随处编辑:扩散模型的视觉方向迁移

ViDiT从图像编辑对中学习连续视觉方向,无需微调即可零样本地应用于任意图像,实现精细解耦的属性编辑控制。

04:00
arXiv cs.CV

自回归图像生成的连续推测解码

提出连续推测解码加速视觉自回归模型,解决低接受率和分布难解析问题,实现2倍以上加速且保持图像质量。

04:00
arXiv cs.CV

2DGH:面向高质量渲染与更好几何特征的二维高斯-埃尔米特泼溅

提出高斯-埃尔米特核改进2D高斯泼溅,提升几何重建和新视角合成质量,在多个数据集上表现更优。

04:00
arXiv cs.CV

增强型视觉-语言模型用于多样化传感器理解:成本高效的优化与基准测试

提出SAFT与DNA优化,用少量传感器数据克服RGB偏见,构建VS-TDX基准,实现资源节约下的高性能泛化。

04:00
arXiv cs.CV

QuaMoE-DRF:ISAC网络中基于多模态动态无线电地图预测的主动波束与速率自适应

提出QuaMoE-DRF框架,通过动态波束SINR场预测实现主动速率自适应,有效速率提升5.67%,中断降低8.35%。

04:00
arXiv cs.CV

中文标题:用于病理组合检索的组织病理学多模态嵌入

中文摘要:提出HOMIE框架,将生成式MLLM转化为病理检索专家,2B参数模型超越7B大模型和双编码器。

04:00
arXiv cs.CV

OmniFall:从场景化到合成再到真实场景——一个用于鲁棒跌倒检测的统一多领域数据集

OmniFall统一多领域数据集(15k视频),微调模型在真实跌倒及倒地状态检测上显著优于零样本大模型。

04:00
arXiv cs.CV

资源受限设备上轻量级CNN的比较分析:预测性能、效率权衡与初始化效应

七种轻量CNN受控对比:EfficientNetV2-S准确率最高,EfficientNet-B0平衡最佳,MobileNetV3-Small适合超低资源,预训练在复杂数据集优势显著。

04:00
arXiv cs.CV

通过卷积最近邻统一卷积与注意力

提出ConvNN统一卷积与注意力,ImageNet-1K上ResNet-50提3.0%,ViT-Base达81.64%。

04:00
arXiv cs.CV

TCMA:面向无人机跨模态文本-视频检索的文本条件多粒度对齐

构建细粒度无人机视频-文本数据集DVTMD,提出TCMA多粒度对齐框架,实现45.5%和42.8%的R@1检索准确率。

04:00
arXiv cs.CV

乐谱基准:标准化光学乐谱识别评估

SMB数据集含685页乐谱,OMR-NED指标实现细粒度错误分析,标准化评估光学乐谱识别。

04:00
arXiv cs.CV

面向精确状态估计:用于3D多目标跟踪的运动动力学卡尔曼滤波器

提出MD-KF自适应调整运动模型,克服常速假设,提升3D跟踪精度与稳定性,降低计算延迟,优于现有方法。

04:00
arXiv cs.CV

UltraImageGen:基于层次化局部注意力机制的高效超高分辨率图像生成

UltraImageGen以层次化局部注意力和低分辨率全局引导,实现高效超高分辨率生成,复杂度近线性,支持8K以上,提速10倍。

04:00
arXiv cs.CV

重新思考扩散模型中的鲁棒对抗性概念擦除

提出语义引导的鲁棒对抗概念擦除方法,单样本实现高鲁棒性与低计算成本,性能达最优。

04:00
arXiv cs.CV

Affogato: 基于大规模自动数据生成的开放词汇可供性定位

提出Affogato框架与750K数据集,自动化生成3D可供性热图,覆盖多样类别,显著提升开放词汇定位性能。

04:00
arXiv cs.CV

MediRound:医学图像多轮实体级推理分割

提出多轮实体级医学推理分割新任务,构建177K对话数据集,设计MediRound模型及纠错机制,有效提升分割性能。

04:00
arXiv cs.CV

NI-Tex: 基于非等距图像的服装纹理生成

提出非等距图像服装纹理生成方法,借助数据集、图像编辑和迭代烘焙,生成高质量PBR纹理。

04:00
arXiv cs.CV

RoadBench:城市道路场景下MLLMs细粒度空间理解与推理的基准测试

提出RoadBench基准,评估MLLMs在城市道路场景的细粒度空间理解与推理,发现其性能显著不足,甚至低于简单基线。

04:00
arXiv cs.CV

PanoGrounder:基于全景场景表示连接2D与3D的VLM三维视觉定位框架

PanoGrounder利用全景场景表示和2D VLM,实现强泛化3D视觉定位,在ScanRefer等数据集上取得SOTA。

04:00
arXiv cs.CV

MonoMSK: 单目三维肌肉骨骼动力学估计

混合数据驱动与物理仿真,从单目视频恢复逼真3D人体运动与力,大幅提升精度。

04:00
arXiv cs.CV

GimbalDiffusion:重力感知的视频生成摄像机控制

提出GimbalDiffusion框架,以重力为参考实现极端角度摄像机控制,解决视角冲突并建立新基准。

04:00
arXiv cs.CV

SONIC:用于一致性修复的噪声频谱优化

通过线性近似和频谱预处理优化初始噪声,实现无需训练的即用型文本到图像模型修复,性能领先。

04:00
arXiv cs.CV

TetraSDF:基于多分辨率四面体网格的解析等值面提取

提出TetraSDF框架,用多分辨率四面体编码与ReLU MLP实现精确零等值面提取,保持网格编码器表现力。

04:00
arXiv cs.CV

通过自重采样实现自回归视频扩散的端到端训练

本文提出无教师框架,通过自重采样解决曝光偏差,实现端到端训练,长视频时间一致性更优。

04:00
arXiv cs.CV

被动场景声音与野外视频的视听相机位姿估计

首次利用被动场景声音结合视频实现相对相机位姿估计,在视觉退化时保持鲁棒,显著提升性能。

04:00
arXiv cs.CV

VisReason:用于视觉思维链推理的大规模数据集

VisReason大规模数据集(489K样本)及专家级子集VisReason-Pro,提升多模态大模型逐步视觉推理与泛化能力。