11121 条条目 · 106 个活跃源
2026年7月30日
04:00
arXiv cs.CV

LumaGuide:扩散模型中免训练HDR生成的分布塑造

LumaGuide通过可微能量引导在采样时塑造亮度分布,无需重训练即可实现HDR生成。

04:00
arXiv cs.CV

基于配准的光谱融合用于未配准WLI/NBI内窥镜病变分割

提出复域融合框架,通过拓扑正则化与可靠性估计引导选择性融合,有效提升未配准WLI/NBI病变分割性能。

04:00
arXiv cs.CV

边缘设备上猛禽物种的轻量级图像分类:通过视频帧提取、知识蒸馏和TensorRT部署扩展稀有物种数据集

利用视频帧扩展数据集和知识蒸馏,实现稀有猛禽轻量分类,边缘设备上FP16推理速度达313 img/s,精度几乎无损。

04:00
arXiv cs.CV

比较基础模型嵌入与传统方法在头颈癌远处转移预测中的性能

CT基础模型嵌入预测头颈癌远处转移AUC达0.791,优于传统方法,且减少专业知识需求。

04:00
arXiv cs.CV

基于样条边界表示的稀疏视角重建与等几何分析仿真

从稀疏RGB图像直接重建多片B样条边界表示,产出紧凑光滑水密几何,原生兼容CAD与仿真,并支持观测场投影。

04:00
arXiv cs.CV

HeteroPROPMT:一种实时且保护隐私的异构协作感知框架

HeteroPROMPT提出实时隐私保护异构协作感知,用提示对齐特征,少量参数提升精度,模态分类准确率超99.99%。

04:00
arXiv cs.CV

Eddeep:一种用于扩散MRI中快速涡流畸变校正的深度学习框架

Eddeep深度学习框架实现快速涡流畸变校正,质量媲美FSL Eddy,推理时间大幅减少。

04:00
arXiv cs.CV

MoSAIC:针对局部部位运动风格迁移的对齐干预监督

MoSAIC提出对齐干预监督与分部位路由,实现局部运动风格迁移,在保留未选区域的同时提升指定部位响应,改善编辑权衡。

04:00
arXiv cs.CV

Zero-Fi: 基于对比信号-语言对齐的零样本Wi-Fi人体活动识别

提出Zero-Fi框架,利用对比信号-语言对齐,无需标注样本即可零样本识别新活动类别,实验验证有效。

04:00
arXiv cs.CV

看见还是知道?多模态大语言模型中的视觉上下文敏感性

多模态大模型能编码视觉证据,但无法可靠控制对先验知识的依赖,导致视觉任务失败。

04:00
arXiv cs.CV

当鱼群难辨:基于双分支弹性的身份追踪

提出TIDE,利用几何对应IoU替代外观特征,以38.7倍计算缩减实现密集鱼群实时追踪。

04:00
arXiv cs.CV

统一多模态模型是否共享同一语义空间?——跨分支引导的视角

跨分支引导揭示理解分支语义可转移至生成分支,反向无效,表明架构统一未必实现语义对齐。

04:00
arXiv cs.CV

FAS-R1:面向推理式人脸反欺骗的统一多任务多模态大语言模型

FAS-R1提出两阶段推理MLLM,结合长链思维数据集与GRPO后训练,实现高精度反欺骗与攻击识别,跨域泛化优异。

04:00
arXiv cs.CV

基于EfficientNet-B0迁移学习和Grad-CAM的可解释图像级痤疮严重程度分级

利用轻量迁移学习实现痤疮严重度四分类,准确率93.5%,Grad-CAM提供临床可解释性,并开源跨平台实现。

04:00
arXiv cs.CV

中文标题:从空间语义到时间上下文:利用注视轨迹进行弱监督医学图像分割

中文摘要:提出TrailNet,融合注视轨迹与注视点,建模时空上下文,结合不确定性解码与知识蒸馏,弱监督分割达81.25%/81.85% Dice。

04:00
arXiv cs.CV

HERMES:一种用于PET/CT头颈部肿瘤分割、TN分期和无复发生存的混合集成方法

HERMES混合集成方法实现PET/CT头颈肿瘤分割、分期与预后,几何特征提升N分期,验证得分0.6454。

04:00
arXiv cs.CV

面向无人机反无人机跟踪的语义感知时间自适应

提出SATATrack模型,通过语义感知传播与时序分布对齐,在无人机反无人机跟踪任务上达到最优性能。

04:00
arXiv cs.CV

CineWeaver:面向电影叙事的免训练、参考可控的多镜头长视频生成

提出CineWeaver,无需训练实现参考可控的多镜头长视频生成,突破时间连续性偏见,支持清晰镜头切换与一致外观。

04:00
arXiv cs.CV

EgoSafe:手机拍摄的第一人称视觉安全理解基准

EgoSafe-Bench通过第一人称视频和层级推理协议,揭示LVLM安全场景中感知强但因果推理脆弱。

04:00
arXiv cs.CV

TPCD:音调-压力对比解码与视觉语言模型中的无标签门控瓶颈

TPCD利用高压提示的分布作为对比解码负分支,将攻击成功率降至0.50%,但需门控机制平衡正面准确率。

04:00
arXiv cs.CV

MedARC:用于三维医学视觉语言模型的免训练自适应视觉标记冗余压缩

MedARC免训练框架融合多线索重要性,合并冗余视觉标记,降低3D医学VLM计算开销并保持诊断性能。

04:00
arXiv cs.CV

3DGBGS:用于紧凑新视角合成的三维粒球高斯泼溅

提出3D粒球高斯泼溅框架,自适应划分点云为粒球,减少锚点数和模型存储,保持渲染质量。

04:00
arXiv cs.CV

理解异质多模态大模型融合中的知识迁移机制:一种简单线性方法

异质MLLM融合的知识迁移具有选择性,增益集中于推理能力,感知性能不变,本质为窄域低干扰下的语言侧推理传递。

04:00
arXiv cs.CV

使用VGG16、VGG19和ResNet50模型对肺部X光图像进行疾病分类

比较三种深度学习模型在肺部X光疾病分类中的表现,ResNet50准确率最高,有助于早期诊断。

04:00
arXiv cs.CV

表示轨迹的重要性:面向分布外检测和图像分类的补充证据

表示轨迹蕴含被最终表示丢弃的证据,能补充分布外检测和图像分类,降低误报率并提升性能。

04:00
arXiv cs.CV

层级、锐度与语料:零样本OOD检测器排名不迁移的原因

零样本OOD检测器排名因互补证据通道(层级与锐度不可互推)而反转,新包装器CEG无需外部数据即可降低敏感性。

04:00
arXiv cs.CV

R-SLPR:基于区域的从小到大的点云配准与对比学习

R-SLPR框架通过区域提议和对比学习,解决小部分点云与大全局点云的配准难题,实现高精度(位置MAE 0.009,旋转1.104)。

04:00
arXiv cs.CV

解耦视觉处理:通过模态专用Transformer替换实现高效多模态适应

提出DVP框架,以轻量Transformer块替换LLM上层解码器处理视觉token,仅训练该块,大幅减少参数,性能竞争。

04:00
arXiv cs.CV

JEPADepth:面向自监督单目深度估计的掩码预测表示学习

JEPADepth结合I-JEPA掩码预测损失与DINOv3表示,提升自监督单目深度估计性能,零推理成本,达到领先水平。

04:00
arXiv cs.CV

SpatialQ: 通过基于视觉的多模态大语言模型理解3D高斯泼溅场景质量

提出多模态质量评估框架,融合3D结构感知与MLLM推理,实现对3DGS场景结构及一致性的可靠评估。

04:00
arXiv cs.CV

Physically Real-time Infrared Attack against Optical Flow Estimation Networks

04:00
arXiv cs.CV

Visko Orbis 1.0:实时交互式长视频生成模型

Visko Orbis 1.0 支持实时更改提示、4K 24fps生成,小时级无漂移,获高偏好与稳定性。

04:00
arXiv cs.CV

CASIAL:几何失真鲁棒图像水印

提出CASIAL框架,通过全局消息传播和几何不变性对齐,有效抵抗多种几何失真。

04:00
arXiv cs.CV

序列-SOD:仿生序列感知尖峰目标检测用于事件相机

序列感知训练提升SNN事件目标检测mAP至26.88,达40Hz,利用时间线索并保持能效。

04:00
arXiv cs.CV

FreeShadow: Training-Free Shadow Removal via Illumination Transfer and Selective Content Preservation in Diffusion Models

04:00
arXiv cs.CV

FPSGen:基于BEV支持传输流的灵活点云场景生成

FPSGen利用BEV先验和传输流,实现灵活点云场景生成,在多个数据集上取得最优性能。

04:00
arXiv cs.CV

TPD:文本到视频扩散模型中的时间先验解耦

TPD构造时间反事实恢复被抑制信号,解决文本到视频后期事件生成失败,无需重训练。

04:00
arXiv cs.CV

FakeIDet3-DB:优化数字攻击与补丁提取以实现安全身份识别基准测试

首个真实身份证件数字操纵数据库,含520万补丁,现有模型检测生成式攻击EER达32.45%。

04:00
arXiv cs.CV

Genie Sim PanoWorld:基于全景场景建模与仿真的无限室内3D世界生成流水线

提出从单张全景图生成可导航3D场景的两阶段流水线,无需多视图,零样本实现高保真重建与实时漫游。

04:00
arXiv cs.CV

锚定与引导扩散:在推理时增强文本到图像生成的忠实度

提出AnchorSteer框架,通过语义锚定和反射引导优化初始化和去噪,显著提升文本-图像对齐忠实度。

04:00
arXiv cs.CV

长尾三维点云数据集蒸馏

提出首个长尾点云蒸馏框架,通过自适应预算分配和分布匹配,在ShapeNet55上提升分类准确率7.0个百分点。

04:00
arXiv cs.CV

基于时序卷积网络的运动传感器在线手写轨迹重建

提出TCN和DTW结合的笔传感器信号处理流程,实现高精度手写轨迹重建。

04:00
arXiv cs.CV

涟漪:基于跨模态循环记忆的实时流式音频-视频生成

Ripple采用跨模态循环记忆实现实时联合音频-视频生成,达28 FPS/480P,支持长视频,性能超越现有方法。

04:00
arXiv cs.CV

文本到图像扩散模型的双重反演:从提示和噪声双角度

Dualin方法联合恢复提示与噪声,实现高保真图像生成与可控编辑。

04:00
arXiv cs.CV

StatePlay:状态感知游戏世界模型实现机制一致生成

StatePlay联合预测视觉与状态,采用混合变换器,状态预测误差低,机制保真度提升18.6%。

04:00
arXiv cs.CV

多模态融合视觉与形态测量特征的鸟类骨骼分类

融合CNN图像与骨骼测量的多模态框架,鸟类骨骼分类准确率86%,科级top-3达75%。

04:00
arXiv cs.CV

See2Think:多模态模型真的使用中间视觉状态吗?

提出See2Think框架评估多模态模型视觉推理,发现依赖视觉状态但渲染是瓶颈,干预下准确率下降超10%。

04:00
arXiv cs.CV

PRISM-Net:患者特异性参考引导的双侧乳腺对称性匹配用于三分类DCE-MRI

提出无配准双侧框架PRISM-Net,利用对侧乳房特征作为患者参考,通过双边匹配与不对称注意提升三分类诊断性能,优于基线方法。

04:00
arXiv cs.CV

改善皮肤镜皮肤癌分类域外泛化能力的鲁棒数据增强探索

mix增强策略提升域外泛化AUC 0.053,光度变换最有效,但需源不相交协议避免偏差。

04:00
arXiv cs.CV

DistillAlign:协调自回归视频蒸馏中的模式覆盖与模式搜索

提出联合蒸馏法协调模式覆盖与搜索,改进自回归视频蒸馏的质量、覆盖和多样性。