10831 条条目 · 106 个活跃源
2026年9月15日
04:00
arXiv cs.CV

MorphoStyle:具有形态控制的动作风格迁移

提出形态感知动作风格迁移框架MorphoStyle,基于形状条件FSQ-VAE,通过对比风格编码、文本引导路由与流形保持调制解耦潜在表示。

04:00
arXiv cs.CV

面向成果导向教育中手写考试标准级评分的视觉语言模型

VLM用于手写考试标准级评分:LoRA微调Qwen2.5-VL一致性超人工,但重复性不足,需校准复核。

04:00
arXiv cs.CV

SPARK:面向更安全视觉语言模型的表示级 KV 记忆对齐

SPARK 两阶段修复多模态 KV 记忆,显著降低视觉语言模型越狱攻击并保持通用能力。

04:00
arXiv cs.CV

SpermYOLO:一种基于YOLO的协同检测器,用于显微图像中精准高效的精子与杂质检测

SpermYOLO基于YOLOv11协同框架,融合四项改进模块,实现显微图像精子与杂质联合检测,精子AP达97.2%,杂质AP达75.4%,轻量且跨场景有效。

04:00
arXiv cs.CV

稀疏自适应锐度感知最小化

提出SA-SAM,随稀疏度自适应调整扰动半径,在80–90%稀疏度下提升损坏鲁棒性并保持干净精度。

04:00
arXiv cs.CV

鸟类物种识别需要多大的输入分辨率?其在边缘设备上的延迟代价是多少?——基于14种输入分辨率与六种架构的设备端实测研究

鸟种识别端侧实测:14种分辨率与6架构,换模型比提分辨率更有效,精度须在部署引擎测,延迟亦关键。

04:00
arXiv cs.CV

基于因子化加权张量Schatten-p范数最小化的鲁棒低秩张量补全

提出两种加权Schatten-p张量分解模型,免SVD、可剪枝秩分量,在多种退化场景下补全精度与鲁棒性俱佳。

04:00
arXiv cs.CV

面向压缩感知的牛顿深度展开

首个基于二阶优化的牛顿深度展开网络NDU-Net,结合牛顿更新与多尺度先验,提升压缩感知重建性能与鲁棒性。

04:00
arXiv cs.CV

S3-Tracker:基于对比随机游走的自监督手术组织追踪

提出自监督任意点追踪,借对比随机游走从无标注内窥镜视频学习轨迹,性能媲美半监督方法,可适应组织形变。

04:00
arXiv cs.CV

面向多任务医学视觉-语言学习的两阶段LoRA混合框架

提出两阶段共享-专用混合LoRA框架,缓解多任务冲突与数据失衡,在FLARE 2026任务3取得优异结果。

04:00
arXiv cs.CV

DTI引导的体素级球谐回归:实现单壳到多壳dMRI合成

提出DTI-SHNet,在球谐域用DTI先验引导3D U-Net回归,实现单壳到多壳dMRI合成。

04:00
arXiv cs.CV

学习连续源响应以实现可泛化的AI生成图像检测

CuRe将检测重设为回归真伪混合比例,以连续源响应子空间抑捷径,十基准平衡准确率89.7%。

04:00
arXiv cs.CV

重新思考伪装图像生成:迈向免训练范式

提出免训练伪装图像生成范式FreeCam,用冻结扩散模型与推理模块,高质量合成伪装并降低目标可检测性。

04:00
arXiv cs.CV

面向农村、区域及偏远地区的移动CT服务:当前实践与未来与远程医疗及监管授权AI的整合

移动CT、远程医疗与AI较成熟,但整合应用于偏远地区仍有限,受监管、成本与连接制约,需多中心验证。

04:00
arXiv cs.CV

轮廓引导光谱路由用于鲁棒实时行人检测

提出轮廓引导光谱路由检测器,按序融合空间与频域线索,小波增强提升雾雨雪低光下实时行人检测性能。

04:00
arXiv cs.CV

超越自然图像:重新审视文档中的AI生成图像检测

AI生成图像检测多聚焦自然图像,文档场景性能骤降;本文构建AIGDoc并揭示文档特性,推动可靠检测。

04:00
arXiv cs.CV

AlayaVista:从全景状态到透视视频的流式世界建模

提出AlayaVista,解耦全景世界演化与透视视频合成,实现低延迟可交互的流式视频世界模型。

04:00
arXiv cs.CV

CGGT:面向三维参数化曲线重建的曲线锚定几何Transformer

CGGT以曲线锚定几何Transformer,从稀疏无位姿多视图图像单次前向重建可编辑的三维参数化曲线。

04:00
arXiv cs.CV

面向低延迟多摄像头行人重识别的生成式AI集成多模态框架

生成式AI多模态行人重识别框架,采用成本感知早退级联,仅模糊时调用语义与人脸模态,降低延迟。

04:00
arXiv cs.CV

基于WAVIE的轻量级泛化DeepFake人脸检测:小波增强视觉中间嵌入

在冻结CLIP上融合小波频域与空间特征,仅用FaceForensics++训练,跨数据集DeepFake检测泛化性显著提升。

04:00
arXiv cs.CV

从视觉归因到临床推理:基于手绘模式的可解释帕金森病筛查

提出可解释帕金森病手绘筛查框架,融合视觉归因与临床推理,提取运动描述符并生成临床解释,性能具竞争力。

04:00
arXiv cs.CV

PRI-Net:面向三维无人机定位的轻量级多模态框架

PRI-Net融合点云溅射、残差注意力与信息瓶颈,实现轻量高精度三维无人机定位,降低特征维度并提升边缘感知效率。

04:00
arXiv cs.CV

PuzzleMate:面向第一视角拼图辅助的多模态大语言模型基准测试

提出第一视角拼图辅助基准PuzzleMate,揭示多模态大模型序列推理与操作指导能力不足。

04:00
arXiv cs.CV

DynEoMT:从在线分割查询中学习目标动态性

DynEoMT利用在线分割查询预测区域动静态,构建离线监督,无需光流,在四大基准保持分割性能。

04:00
arXiv cs.CV

MCIQA-2K:面向彩色化图像的多维数据集与无参考质量评估基准

构建2千张彩色化图像、三维度标注的无参考质量评估基准MCIQA-2K,并提出MCIQA框架,性能优于现有方法。

04:00
arXiv cs.CV

面向盲图像修复及更多任务的上下文感知互学习

提出上下文感知互学习CAML,使掩码估计与图像修复互用上下文,在盲修复等多视觉任务达最优。

04:00
arXiv cs.CV

使用DICOM共享计算病理学中的标准化图像衍生数据

研究将病理图像衍生数据(如分割掩膜)转为DICOM标准,在NCI IDC公开共享五个数据集并开源工具。

04:00
arXiv cs.CV

遥感智能体式变化视觉问答中的选择性工具调用

提出选择性工具调用框架,使VLM按需调用变化分析工具,显著提升遥感变化VQA精度。

04:00
arXiv cs.CV

基于LAF-YOLOv10的无人机航拍图像小目标检测

LAF-YOLOv10集成四项技术后无人机小目标检测性能反降,mAP 24.0%低于YOLOv10n,主因是P2/P5换头与PC-C2f主干交互。

04:00
arXiv cs.CV

建筑即仓库:KIR——面向智能体编写建筑信息模型的类型化中间表示

KIR用类型化中间表示将建筑作为版本库程序编译到宿主,显式表达拒绝、未知与状态约束,实验验证可拒绝错误。

04:00
arXiv cs.CV

TTDF:一种用于可靠手术阶段转换检测的两阶段框架

提出两阶段框架TTDF,将手术阶段转换检测建模为事件级任务,逐级过滤候选,减少误报并保持召回。

04:00
arXiv cs.CV

ESAFusion:基于局部几何互补与多尺度自适应交互的激光雷达-4D雷达融合三维目标检测

提出ESAFusion,结合局部几何互补与多尺度自适应交互融合激光雷达-4D雷达,VoD mAP达74.60%,雾天鲁棒。

04:00
arXiv cs.CV

Open-UniMo:迈向开放世界中统一的动作-语言理解与生成

Open-UniMo统一动作-语言大模型,以共享词元空间与动作思维链实现双向建模,生成反哺理解,性能达SOTA。

04:00
arXiv cs.CV

面向扩散逆问题的直接条件转移采样

提出DCTS,直接随机流近似条件转移采样,估计测量条件干净均值;四类逆问题重建具竞争力,最高加速16.8倍。

04:00
arXiv cs.CV

逆向时空疾病进展建模

提出逆向疾病进展预测:从后期病变影像重建早期健康状态,用3D VQ自编码器与神经常微分方程,在脑MRI基准上优于基线。

04:00
arXiv cs.CV

SCOUT-SLAM:野外复杂场景下结构耦合的双不确定性感知3DGS SLAM

提出共享基网络结构耦合双不确定性SLAM,低秩适应解耦跟踪不确定性,空间自适应先验抑制重建伪影,动态场景达SOTA。

2026年9月14日
04:00
arXiv cs.CV

不可逆火灾损伤后物体理解的特征恢复

提出TRACE基准与即插即用特征恢复模块FRM,把退化特征映射为原始表示,提升火灾后物体检测与理解。

04:00
arXiv cs.CV

视频记忆是否使用了它检索到的内容?记忆特异性的因果审计

读取时记忆替换可区分记忆收益与特异性:多数视频模型靠通用表征,SAM 2则依赖确切检索内容。

04:00
arXiv cs.CV

重新审视多目标跟踪基线:基于多保真度贪心坐标搜索的超参数优化

系统将超参数优化用于多目标跟踪,提出多保真贪心坐标搜索,八个组合均超手工与已发表基线。

04:00
arXiv cs.CV

超越Argmax:面向广义少样本3D分割的冻结基础模型组合语义保留机制研究

冻结基础模型组合中,保留多语义候选而非argmax可减少信息瓶颈,提升广义少样本3D分割性能。

04:00
arXiv cs.CV

单查询式以人为中心的双手手-物交互检测

提出以人为中心的单查询双手手-物交互检测,统一人体、手部与交互目标,解决多人归属歧义并提升解析。

04:00
arXiv cs.CV

HSI-Road 重新标注:表面感知的道路场景分割

新增六类表面标注与RGB-NIR配准,评估六种分割模型;匹配分辨率下RGB+NIR多优于单模态,NIR具互补性。

04:00
arXiv cs.CV

以物理作为多模态模型中材料推理的度量与纠正标签

多模态模型材料推理常违反物理规律;提出无标注基准MatPCR,直接验证推理链物理一致性。

04:00
arXiv cs.CV

当真实标注保真度至关重要:一种使用视觉Transformer与机器学习的协同无人机系统小麦条纹花叶病毒检测框架

无人机多光谱与ViT检测WSMV,处理标签偏差致高精度虚高;ELISA真值下泛化弱,标签保真度关键。

04:00
arXiv cs.CV

USPLIT-VQA:面向视觉问答的U形拆分学习与贡献感知加权聚合

提出USPLIT-VQA:客户端保留首尾层的U形拆分学习保护VQA隐私;CAWA按梯度相似度抑制恶意更新,内存与通信最高降5.8/10.8倍,单恶意影响降超98%。

04:00
arXiv cs.CV

QuPAINT:面向量子材料表征的物理感知多模态推理

提出物理感知多模态框架QuPAINT,利用合成数据与物理先验,实现量子材料薄片层数表征,性能领先。

04:00
arXiv cs.CV

UniMo:统一人类与动物动作生成

提出点云框架UniMo统一生成人兽动作,并发布超现有动物数据集102倍的UniML3D,在多个基准上达到最优。

04:00
arXiv cs.CV

VS-Splat:面向稀疏视图端到端三维物体重建的体素选择性前馈高斯泼溅

VS-Splat以可学习体素选择,仅靠二维渲染监督将高斯基元聚焦物体区域,稀疏视图重建优于现有方法。

04:00
arXiv cs.CV

面向人车交互的车内追踪中断场景下上下文感知因果注视预测

提出因果注视预测器CCGF,融合历史与场景特征,在追踪中断时恢复司机注视,中位误差175.7像素。

04:00
arXiv cs.CV

UFO:面向多模态图像生成中全条件对齐的评估链

提出UFO统一框架与UFO-Bench,原子评估链分解全条件对齐,人类偏好相关性提升15.25%。