11051 条条目 · 106 个活跃源
2026年8月12日
04:00
arXiv cs.CV

UniMod:通过跨模态与模态内对齐增强多模态医学诊断

UniMod通过跨模态与模态内对齐,强制各模态独立提取诊断特征,缓解捷径学习,提升多模态诊断精度。

04:00
arXiv cs.CV

ENCORE:用于低剂量CT去噪的高效噪声上下文感知表示

提出高效噪声上下文感知框架基于真实噪声分布自适应卷积提升低剂量CT去噪质量与效率支持零样本条件去噪

04:00
arXiv cs.CV

CasDeblurGS:从两张模糊图像实现三维高斯泼溅的级联二维到三维多视图一致性

提出CasDeblurGS,仅用两张模糊图像无位姿重建三维场景,级联二维到三维引导,提升新视角质量与一致性。

04:00
arXiv cs.CV

用于对焦测距的纹理二阶理论

波动光学二阶纹理理论:表面微几何产生散斑纹理,窄带滤波增强对比,改善无纹理场景的被动对焦测距。

04:00
arXiv cs.CV

DriveVLA-M0:自动驾驶的故障感知记忆增强

提出故障感知记忆增强的视觉语言动作模型,检索失败案例并轻量微调修正,导航基准上最优。

04:00
arXiv cs.CV

桥接事件流与DiT:事件引导的视频帧插值

提出基于适配器的事件引导框架,利用事件流和光流约束预训练扩散模型,提升视频插帧质量与时间一致性。

04:00
arXiv cs.CV

FormStruct-Bench:表格文档结构识别的层次化诊断基准

提出层次化诊断基准,评估表格文档结构识别;文档级最佳83.85%,细粒度低于18%,揭示层级恢复短板。

04:00
arXiv cs.CV

前列腺癌CT到PSMA PET合成中的病灶感知自适应傅里叶神经算子

提出LAFNO,以CT代理通道实现病灶感知合成,兼顾图像质量与病灶活性准确性。

04:00
arXiv cs.CV

DynaPPI:面向AI驱动的蛋白质互作组学进展的大规模动态蛋白质数据集

提出含复合物形成动态轨迹的蛋白质数据集,助力扩散模型预测未知多链结构,推动互作组学。

04:00
arXiv cs.CV

GeoSeg-OV:以结构引导弥合地理空间鸿沟的开放词汇遥感分割

提出GeoSeg-OV,用VFM结构引导聚合与解码,HRLC基准上超SOTA,跨域零样本泛化能力强。

04:00
arXiv cs.CV

MammoMix:利用专家混合实现鲁棒的乳腺X线摄影病灶检测

提出MammoMix专家混合框架,分域训练专家,门控自适应融合并校准,提升乳腺X线病灶检测的鲁棒性与泛化性。

04:00
arXiv cs.CV

FUSE:面部视频帧统一压力估计

该框架融合全视频帧为单一输入,无需时间窗口,压力估计准确率达69.44%。

04:00
arXiv cs.CV

流强制:为稳健流式视频生成构建统一训练轨迹

提出流强制统一训练,解决推理不一致,UCF-101上FVD降36.6%,零样本长视频FVD降27.9%。

04:00
arXiv cs.CV

SapiensID 2.0: Aligning Human Recognition Foundation Models with Human Perception

04:00
arXiv cs.CV

SparSTAR:面向时空自回归视频合成的稀疏注意力

SparSTAR提出免训练块稀疏注意力,逐尺度重选关键块,在720p视频生成中保持质量,端到端加速约1.6倍。

04:00
arXiv cs.CV

DSAR:用于逼真可动化虚拟化身的时间布料动力学双流自回归建模

提出双流自回归框架,显式建模布料时间因果性,改进渲染质量、时序一致性和姿态泛化,实现逼真布料动态。

04:00
arXiv cs.CV

面向色彩保真的低光图像增强:自适应颜色去偏与饱和度校正

提出CAGE圆柱颜色校正框架,通过自适应去偏与饱和度校正,提升低光图像色彩保真度。

04:00
arXiv cs.CV

直通现实:感知一致性流匹配实现高效图像恢复

PCFlow用感知一致性流匹配联合优化失真与感知,以潜一致性感知损失和梯度投影,轻量卷积实现高效恢复

04:00
arXiv cs.CV

当视觉化为文本:视觉语言模型中基于跨模态残差引导的视觉令牌剪枝

提出跨模态残差引导的免训练视觉令牌剪枝法,仅用11.1%令牌保持97.5%性能,加速推理。

04:00
arXiv cs.CV

语义感知多模态预训练:解锁医学表格数据的力量

提出语义感知框架,建模表格二维结构,用自适应掩码和软标签离散化,在皮肤病和眼科数据集上达到最优。

04:00
arXiv cs.CV

SafeCap:利用图像描述强化学习提升LVLM安全性

SafeCap用图像描述强化学习,让模型先描述后回答,安全评分提升3.7-19点,保持视觉性能,优于SFT、DPO等。

04:00
arXiv cs.CV

特定领域下的文本图像检索再思考

构建SecMM-TBIR监控多匹配基准,提出语义感知微调框架SAFT,mAP@20提升7.8点,并改善通用域性能。

04:00
arXiv cs.CV

动态上下文适配器:高效地将历史注入视觉-语言模型

提出动态上下文适配器,用固定大小压缩记忆向视觉语言模型注入历史,降低计算与内存开销,提升长时任务性能。

04:00
arXiv cs.CV

基于HamNoSys的手语细粒度孤立手形识别数据集与基线

提出144,000张RGB图像、160类手形的基准数据集,评估四种模型,揭示跨人泛化性能显著下降,提供可复现资源。

04:00
arXiv cs.CV

π-SUB:用于水下图像增强的物理信息合成水下基准数据集

提出物理信息合成水下数据集π-SUB,弥合合成与真实差距,提升增强效果与泛化性。

04:00
arXiv cs.CV

高斯雕刻:通过场优化的端到端可控表面重建

提出高斯雕刻:将高斯锚定于表面,双层训练优化场,实现端到端高质量可控表面重建。

04:00
arXiv cs.CV

InSight-doc:长文档理解的智能体视觉感知

自适应分辨率视觉感知,SFT+RL训练,精度+4.3~16.4,幻觉-40%,延迟-41~68%

04:00
arXiv cs.CV

MedUP:唤醒医学视觉-语言模型中的统一理解与感知

MedUP统一感知与理解,以UniMedTok编码掩码,性能超越现有Med-VLM,媲美专用分割器。

04:00
arXiv cs.CV

基于边缘和形状感知深度网络的布料拆垛精确顶层布料分割

提出边缘与形状感知分支训练架构,提升堆叠布料顶层分割精度,优于基线。

04:00
arXiv cs.CV

Chartography:专业图表理解基准

提出Chartography基准,含100个专业图表任务,30种前沿模型最佳仅45%准确率,失败主因是视觉感知不足。

04:00
arXiv cs.CV

面向自动驾驶的跨视角序列视觉定位与时空上下文建模

提出时序上下文增强的跨视角序列定位框架,误差从3.80米降至1.57米,显著提升精度。

04:00
arXiv cs.CV

PolypVision:用于结直肠息肉分类与分割的三阶段分层深度学习框架

提出三阶段分层深度学习框架,实现结直肠息肉分类与分割,AUC约0.99,检测mAP94.4%,跨设备适用。

04:00
arXiv cs.CV

工业密集预测中的数据效率再思考:预训练一致性而非归纳偏置决定ViT的低数据优势

预训练一致性而非归纳偏置确定ViT低数据优势;近域超CNN,远域CNN优;校准颈部权重获2.5倍增益。

04:00
arXiv cs.CV

弥合严重跨模态错位:基于显式特征域仿射配准的端到端可见光-红外目标检测

提出JFRDet网络,以显式仿射配准和光照引导融合应对严重跨模态错位,在DVMA基准上达到SOTA。

04:00
arXiv cs.CV

用于单帧环视驾驶重建的视觉几何基础感知高斯

提出视觉几何先验感知的高斯重建框架,借助几何一致与外观解耦及尺度预热,实现最优单帧环视渲染。

04:00
arXiv cs.CV

MMArt:面向视觉艺术理解的多视角多模态数据集

构建多视角艺术理解数据集,七万幅画作配四类独立标注,分析显示视角互补,单一视角无法满足所有任务。

04:00
arXiv cs.CV

超越像素:从视频先验到4D世界

提出潜空间到4D的直接生成方法,利用视频潜空间绕过RGB,性能超越现有方法。

04:00
arXiv cs.CV

面向可证明多方向场景文本识别的旋转不变性嵌入

提出旋转不变网络,理论保证旋转不变性,多方向场景文本识别最优。

04:00
arXiv cs.CV

自几何:面向几何一致3D视觉基础模型的无真值即插即用测试时自适应

提出Self-Geometry,用2D像素对应作伪真值,施加显式多视图几何约束,经测试时自适应提升多种3D基础模型的位姿与几何估计。

04:00
arXiv cs.CV

保留网格的知识蒸馏:数据稀缺下向视觉Transformer迁移卷积归纳偏置

提出iBKD框架,通过保留网格结构将卷积归纳偏置迁移至ViT,数据稀缺时性能优于现有方法,且无推理开销。

04:00
arXiv cs.CV

利用显著性引导的基元合并的紧凑前馈三维高斯

提出显著性引导的合并流程,将前馈每像素高斯压缩至1/20,保持视觉质量,支持质量效率权衡。

04:00
arXiv cs.CV

重新思考LLM验证:证据结构、不确定性与选择性精化

提出两阶段框架,仅对模型弃权时进行本体论接地,将弃权用作控制信号,显著提升医学假设验证准确率,无需显式知识图谱。

04:00
arXiv cs.CV

InterPruner:基于泰勒隐式准则与语言先验调制器的多模态目标检测交互式结构化剪枝

首个面向多模态检测的交互式结构化剪枝,用泰勒隐式准则与语言先验评估通道,剪枝半数通道性能不降反升。

04:00
arXiv cs.CV

超越固定亮度:迈向全色与正色图像着色

提出亮度无关着色框架,将着色视为全RGB图像编辑,用混合灰度目标适应全色与正色输入,减少伪影。

04:00
arXiv cs.CV

看哪里?:VLM中视觉编码器的因果追踪

因果追踪发现,高因果视觉标记常在目标区外;模型借外观线索理解结构,视觉定位、使用与推理存在差距。

04:00
arXiv cs.CV

MIRA:面向智能体诊断的医学图像反思

MIRA框架通过工具搜索与反思验证提升医学视觉诊断,平均64.73,提升基线7.44,降低有害工具判断。

04:00
arXiv cs.CV

FADE:从被动验证到主动发现的反事实视频理解

FADE框架采用证据优先两阶段训练和渐隐锚强化学习,实现反事实视频主动发现,性能超越GPT-5.6。

04:00
arXiv cs.CV

MVTrack:基于压缩比特流的超快无外观运动目标跟踪

基于H.264比特流直接追踪运动目标,参数少60倍、算力少40倍、延迟降8.6倍,超越YOLO26n。

04:00
arXiv cs.CV

E³mo-Bench:基于贝叶斯成对对齐的多模态诱发与表达情感理解可扩展基准

提出E³mo-Bench基准,含12314问答对,评估诱发与表达情感,用贝叶斯对齐提升标注,揭示范式性能失衡。

04:00
arXiv cs.CV

BPG:领域增量学习中可塑性与泛化性的平衡

提出BPG框架,动态适配器维度与软域混合,平衡可塑性与泛化,域增量SOTA,遗忘低至0.22%。