10732 条条目 · 106 个活跃源
2026年9月29日
04:00
arXiv cs.CV

语言增强的视频动作预判:设计基础、基准与开放挑战

综述提出证据感知设计图谱,交叉任务设定与语言介入点,归纳五类任务,主张假设需匹配验证而非因果结论。

04:00
arXiv cs.CV

面向SoF数据集的局部人脸识别CNN骨干网络迁移学习对比研究

SoF局部人脸识别对比三种CNN迁移学习,PFN达97.4%准确率,表现最佳。

04:00
arXiv cs.CV

基于事件的行人横穿检测的无监督脉冲特征学习:无需标注训练数据逼近监督精度

无监督脉冲特征学习在行人横穿检测中达90.3%准确率,接近监督,性能主要取决于读出协议。

04:00
arXiv cs.CV

迈向AI辅助家禽球虫病诊断:评估Gemini与BiomedParse在艾美耳球虫显微图像上的表现

Gemini诊断艾美耳球虫显微图像准确率仅14.9%,偏倚严重,报告未验证、分割不完整,尚不可靠。

04:00
arXiv cs.CV

低光照条件下的视频描述生成:基于高效不确定性感知的描述校正

提出高效不确定性感知校正框架,无需微调VLM,仅用44样本提升低光照视频描述质量。

04:00
arXiv cs.CV

迈向透明诊断:疟疾检测中的架构权衡与可解释性研究

评估多种深度学习模型用于疟疾检测,MobileNetV2精度96.35%且最轻快,自提模型达97.67%,并用XAI提升可解释性。

04:00
arXiv cs.CV

面向工业目标检测的可读性可解释AI:视觉语言模型适配

微调视觉语言模型,为工业目标检测生成非专家可读解释,清晰度等优于GPT-4o-mini

04:00
arXiv cs.CV

基于TrOCR的天城文手写字符识别:一种可实时Web部署的Transformer模型

微调TrOCR识别天城文手写字符,字符错误率3.95%、准确率96.05%,并实现低延迟Web部署。

04:00
arXiv cs.CV

RemTraceNet:不可见水印攻击的小样本取证检测

RemTraceNet融合残差、局部关系与频域统计特征,实现水印移除痕迹的小样本取证,TPR@1%FPR达82.75%~88.17%,远超基线。

04:00
arXiv cs.CV

解耦并丢弃:基于重建式灰度残差分解的稳健通用图像水印去除

提出DnD通用水印移除法:解耦语义灰度载体与残差分支,丢弃残差去水印;在七类水印上稳健且保真。

04:00
arXiv cs.CV

面向乳腺癌诊断的可解释深度学习架构感知鲁棒性评估

系统评估九种可解释方法在四类深度学习架构上的乳腺癌超声诊断,发现解释质量取决于架构与方法交互,需联合选择。

04:00
arXiv cs.CV

现代化压缩域视频字幕生成器:SigLIP2 与 GPT-2 替换的对照研究

压缩域视频字幕中,SigLIP2替换CLIP提升指标,叠加GPT-2因过拟合反削弱增益,需权衡延迟。

04:00
arXiv cs.CV

RPA:面向脑电图和脑磁图图像检索的残差图块 Token 适配器

提出轻量 RPA,利用 ViT 中间层全部图块 Token 对齐脑电/脑磁图,在 THINGS-EEG2/MEG 上达 SOTA。

04:00
arXiv cs.CV

OmniFysics-Captioner 技术报告:将全模态理解扎根于物理世界,以提升描述能力

提出物理感知全模态描述框架,构建数据与评测基准,模型比肩 Gemini 3.1 Pro 并达最优水平。

04:00
arXiv cs.CV

找不到沃尔多:评估视觉语言模型对图像分辨率与细节级别的敏感性

提出受控评估框架及AUSC、PVS指标,发现VLM高分辨率下三类失败模式,连SOTA也降效。

04:00
arXiv cs.CV

基于混合优化策略的集成深度学习框架用于家蚕自动化健康检测与分析

提出混合残差注意力网络与集成自适应动量优化器,家蚕图像六分类准确率达98.67%。

04:00
arXiv cs.CV

基于选择性推断的多示例学习统计检验及其在计算病理学中的应用

提出选择性推断框架评估高注意力实例,校正数据依赖选择,计算有效p值,控制I类错误,用于病理全切片。

04:00
arXiv cs.CV

CLC-YOLO:一种紧凑的通道门控原型网络,用于实时防泄漏的乳腺超声病灶分割

CLC模块仅增64参数与0.0966ms开销,四数据集分组宏Dice最高提升3.11个百分点。

04:00
arXiv cs.CV

MDL校准的显著性增益对编码:面向子词分词的复制感知自动停止

MDL-SG以复制检验和MDL增益自动停止子词合并,在WikiText-103上取得更低BPC。

04:00
arXiv cs.CV

智能体式视频理解:综述

综述智能体式视频理解,形式化智能体循环,按挑战-设计分类梳理关键方法、基准与评估,展望视频原生智能体。

04:00
arXiv cs.CV

孟加拉水稻叶片病害跨域泛化基准:强增强有效,AdaBN有害,自监督ViT亦失效,主因采集条件偏移。

孟加拉水稻叶片病害跨域泛化基准:强增强有效,AdaBN有害,自监督ViT亦失效,主因采集条件偏移。

04:00
arXiv cs.CV

PanoFuse:全景增强的视觉-语言-动作学习与解耦语义-几何路由

PanoFuse以全景分支与解耦语义-几何路由为VLA补充全局上下文,显著提升遮挡及新场景下操作成功率。

04:00
arXiv cs.CV

水印藏身何处?面向不可见水印去除的推拉解耦

提出推拉解耦,单图去除不可见水印,无需参考或密钥;实验显示解码器依赖辅助潜变量,理论仅为事后解释。

04:00
arXiv cs.CV

LatentReRig:一种基于SDF的双解码器VAE,用于潜空间变形条件化

基于SDF双解码器VAE,在潜空间学习可复用姿态变形方向,可迁移至未见角色,局部修正仍不足。

04:00
arXiv cs.CV

当检索造成伤害:胸片报告生成中检索诱导幻觉的测量与解释

胸片报告检索增强诱发幻觉,错配时F1降至0.043、幻觉率达0.98;病理门控去61%无支撑证据。

04:00
arXiv cs.CV

SWT:基于滑动窗口、小波变换和最优传输的自监督视频目标分割

提出自监督视频目标分割框架SWT,融合滑动采样、小波变换和最优传输,仅需COCO训练一次,在多个VOS数据集上表现优异。

04:00
arXiv cs.CV

PanOVOcc:融合长期空间体素记忆的具身全景开放词汇占用建图

提出免训练框架PanOVOcc,从全景序列持续构建开放词汇语义占用图,并建立基准,性能显著提升。

04:00
arXiv cs.CV

通过神经网络权重替换实现的高容量鲁棒医学图像外泄

将医学图像编码入模型初始化权重,30MB模型可藏99例脑MRI,常规净化后仍可重建,构成新型隐私风险。

04:00
arXiv cs.CV

频域AI生成图像检测:探索解码器与通道注意力用于特征细化

FFT结合EfficientNet-B0检测AI生成图像,用解码器与通道注意力细化特征,Attention U-Net最优,准确率85.51%。

04:00
arXiv cs.CV

GERIS:一种用于过滤车牌数据增强中实例相关标签噪声的博弈论框架

GERIS用非合作博弈筛选车牌数据增强中的低质噪声样本,提升识别精度与鲁棒性。

04:00
arXiv cs.CV

Fysiverse-3D-SimReady 技术报告:面向实用三维世界重建的智能体物理仿真

从单张RGB图像重建可仿真多物体场景,经可微渲染精化位姿并修正接触,实现目标驱动的物理交互仿真。

04:00
arXiv cs.CV

EgoTSR++:面向任务进度理解的第一人称时空推理

提出EgoTSR框架,诊断并提升第一人称任务进度理解,缓解顺序偏差,在长时程与非单调轨迹上显著提升。

04:00
arXiv cs.CV

PEEL-DDPM:面向去噪扩散概率模型的物理赋能证据学习

PEEL-DDPM以物理赋能证据学习,实现扩散模型可辨识、可分解且校准良好的不确定性量化。

04:00
arXiv cs.CV

LukeNet:集成XAI模型的轻量级CNN,用于智能急性淋巴细胞白血病检测与管理

集成XAI的轻量CNN LukeNet,用于急性淋巴细胞白血病检测,准确率99%,优于六种主流CNN。

04:00
arXiv cs.CV

一瞥地球:面向超高分辨率遥感理解的无训练主动聚焦

免训练GazeEarth:问题引导选区和全场景注视重采样,固定像素预算提升超高分辨率遥感理解。

04:00
arXiv cs.CV

VisionPsy-Nano:提升端侧视觉语言模型的准确率、效率与可靠性

诊断驱动后训练,教师模型压测挖掘失败模式转为对齐监督,0.5B端侧VLM准确率、效率与可靠性齐升。

04:00
arXiv cs.CV

组件失效下的融合:集成式AI生成图像检测中的负面结果与失效模式

集成融合仅在目标域重拟合时才有效;缺失值弃权被误处理而失效;建议采用双架构法定人数规则。

04:00
arXiv cs.CV

衡量电影百年间摄影机距离的演变

分析五千余部百年影片,录音与电视技术引发镜头距离突变;女性多被近景拍摄,动画既继承又突破实拍传统。

04:00
arXiv cs.CV

超越体积重叠:面向拓扑感知的冠状动脉分割表面匹配

提出表面匹配度量与可微表面损失,恢复冠脉远端血管,提升表面F1且Dice相当。

04:00
arXiv cs.CV

看见热量:从光学图像合成高分辨率木材热响应

提出端到端框架,从木材RGB图像合成高分辨率热响应,并训练神经代理模型实现快速热推断。

04:00
arXiv cs.CV

课堂视频多任务情感状态识别中的维度特定不平衡与自适应混合标签策略

针对课堂视频情感识别中维度特异性类别不平衡,提出自适应混合标签策略,轻量模型四维平均F1达47.70%

04:00
arXiv cs.CV

UNMATCH:面向取证式图像-声明验证的选择性非平衡Token-图像块匹配

提出方向性多尺度覆盖表示,刻画图像-声明局部双向亲和,轻量分类器Macro-F1达69.82。

04:00
arXiv cs.CV

SynDORBench:在物理约束可见性条件下评估LVLM感知鲁棒性

提出SynDORBench物理基准,评估LVLM在距离、光照等受限下的感知鲁棒性,发现像素密度比模型规模更关键。

04:00
arXiv cs.CV

基于通用光度立体的视觉触觉传感免标定表面法线估计

提出通用光度立体网络,免标定估计视觉触觉传感接触面法线,恢复细节,多传感器验证可跨传感器迁移。

04:00
arXiv cs.CV

3DGS-SC:面向3D高斯泼溅的受控静态屏幕内容基准

3DGS-SC:受控静态屏幕内容基准,揭示图像保真度与屏幕可读性脱节,PSNR与OCR排序多不一致。

04:00
arXiv cs.CV

HGPTrans:用于汽车气动阻力系数预测的层次图池化Transolver

HGPTrans融合图卷积、切片注意力与层次池化,从车身网格预测气动阻力系数,推理仅约0.29秒。

04:00
arXiv cs.CV

用于旋转稳定360°场景理解的规范等变注意力

提出GE-RPE规范等变相对位置编码,零参数消除旋转规范依赖,显著提升360°场景理解稳定性和低标签分割。

04:00
arXiv cs.CV

让3D CT报告生成器说出它已知的内容

3D CT报告生成器隐状态已含诊断信息却未能输出;SelfCue对比解码找回,F1升至0.481。

04:00
arXiv cs.CV

全景场景程序扩散变换器

PSP-DiT将全景场景程序作为潜变量与图像联合去噪,提升组合式文生图的计数、属性绑定与关系建模。

04:00
arXiv cs.CV

面向AIGC图像的自适应码率单步扩散压缩

面向0.025BPP超低码率AIGC图像,微调四个码率专用单步扩散模型,按真实码流大小用背包选优,排名第五。