10941 条条目 · 106 个活跃源
2026年8月29日
04:00
arXiv cs.CV

Loop-Mamba:退化感知与共享记忆的循环Mamba老照片修复框架

提出循环状态空间框架Loop-Mamba,将老照片修复视为渐进状态演化,引入语义引导退化估计与共享结构记忆,轻量高效,优于现有方法。

04:00
arXiv cs.CV

残差流匹配与动态交叉交互的3D多人运动预测

提出先验引导残差流匹配框架,结合动态交叉交互与解耦关节运动架构,提升3D多人运动预测精度,达到最优。

04:00
arXiv cs.CV

ET-Prune:面向文本密集型多模态大语言模型的证据感知动态预算视觉令牌剪枝

ET-Prune:证据感知动态预算剪枝,文本密集任务中保留一半视觉令牌即领先或持平基线。

04:00
arXiv cs.CV

X²Localizer:面向渐进式跨视角视频地理定位的跨粒度对齐

提出PCVG与跨粒度对齐法,结合滑动窗口重定位,提升早期定位,单帧Recall@1+4.7。

04:00
arXiv cs.CV

BehaviorWorldGen:利用可控行为感知的结构化世界生成,打通行动模型与世界模拟器的闭环

提出行为感知结构化世界生成框架,实现可控多智能体交互,提升困难场景的动作模型性能。

04:00
arXiv cs.CV

PPE-Bench:针对公私信息纠缠的MLLM遗忘评估基准

提出PPE-Bench,评估公私信息纠缠下的MLLM遗忘,发现现有方法减隐私泄露却损公共信息。

04:00
arXiv cs.CV

面向运动生成、编辑与结构内重定向的统一条件流

提出统一条件流模型,将运动生成、编辑与结构内重定向统一为条件调制传输,零样本实现,无需任务微调。

04:00
arXiv cs.CV

棋盘格:干净标签后门攻击的闭式数据无关触发器设计

提出棋盘格触发器,无需数据与训练的闭式设计,低投毒率下SOTA且抗防御。

04:00
arXiv cs.CV

统一预测与规划:冲突感知分离参数训练

提出冲突感知分离参数训练(DPT),分离任务参数以缓解技能冲突,实现拥挤环境下高效、安全的统一预测与规划。

04:00
arXiv cs.CV

仿真预训练灵巧操作

仿真VR采集灵巧手数据预训练,微调后优于从零训练,验证仿真遥操作可支撑真实灵巧操作。

2026年8月28日
04:00
arXiv cs.CV

Video-FLAIR:不在于是否推理,而在于如何推理

Video-FLAIR用强化学习自适应选择推理方式,提升准确率并降低开销。

04:00
arXiv cs.CV

手术视频生成:从扩散模型到世界模型的综述

综述手术视频生成研究,分无条件、条件与世界模型三类,强调从像素合成转向场景因果建模,并指出临床合理性等瓶颈。

04:00
arXiv cs.CV

模态成熟度指数:评估全能模型多模态能力的基准

提出模态成熟度指数(MMI),评估大模型在五种模态及其组合的输入输出能力。测试前沿模型,模态存在得分极低,反映多模态生成能力严重不足。

04:00
arXiv cs.CV

找到正确证据:面向长视频的因子引导由粗到细推理

提出PACE因子引导框架,两阶段获取对比线索,提升长视频问答证据恢复与准确率,优于多种基线。

04:00
arXiv cs.CV

卷积神经网络图像空间中信息机制的统一框架

提出CNN信息传播统一框架,联系离散滤波器对称性与相对论能量-动量关系,解释图像尺度空间与拓扑结构。

04:00
arXiv cs.CV

基于多源影像与预测融合的木质植被制图框架,提升数据效率与精度

提出多源影像与预测融合框架,提升木质植被制图数据效率与精度,显著降低误差。

04:00
arXiv cs.CV

VIPER:专家策展的兽医病理学视觉语言模型基准

首个兽医毒理病理学基准,1251题/419图,评估16模型,揭示与人类病理差距及过度诊断风险。

04:00
arXiv cs.CV

基于损失对齐的树木砍伐学习,实现零样本再生长与树木分割

通过损失缩放系数对齐模型目标,精准提升精度或召回,并利用图像增强实现零样本迁移,树木分割误差降18.2%,再生长F1达0.845。

04:00
arXiv cs.CV

基于文本到图像潜在扩散模型与多模态参考的零样本视频恢复与增强

提出零样本视频恢复框架,利用文本到图像扩散模型与多模态参考,推理时间降至三分之一,增强时间一致性。

04:00
arXiv cs.CV

Procedura:程序化控制的智能体3D建模

程序式智能体用语言模型将三维形状编写为可编辑的程序化装配,经编译与视觉检查优化,产出尖锐零件模型,超越现有。

04:00
arXiv cs.CV

NeuDonatello:不确定性感知的神经SDF精确学习框架

提出不确定性建模框架NeuDonatello,用蒙特卡洛采样估计SDF不确定性,自适应正则化与密度转换,仅凭RGB图像实现高精度表面重建。

04:00
arXiv cs.CV

基于机器学习的文本识别模型与应用的系统文献综述

综述97项OCR研究,分析近十年AI模型演进,指出多语言、手写体等挑战,提出自监督、多模态、TinyML等改进方向。

04:00
arXiv cs.CV

HUG-VIS:视觉智能中以人为本的理解与生成多模态基准

提出HUG-VIS统一基准,含8400段多模态视频,覆盖四任务,发现视觉情感识别最弱、边界保真度是难点。

04:00
arXiv cs.CV

基于异步事件流的实时无监督目标发现

提出无需训练的实时无监督目标发现框架,基于自适应时空聚类与滤波,高效去噪并发现运动目标,性能超越现有方法。

04:00
arXiv cs.CV

扩散多模态大语言模型的视觉信息引导并行解码

提出VIG-Sampler,按图像注意力排序并惩罚相似分布,提升生成质量,减少解码步数。

04:00
arXiv cs.CV

文本到种子生成:利用扩散模型作为文本引导的种子生成器,实现免训练的开词汇种子语义分割

将开放词汇分割重构为文本定位种子,再用SAM扩展区域,无需训练即达强性能。

04:00
arXiv cs.CV

FU-Mamba:一种面向口内扫描图像分割的频率增强动态扫描框架

提出动态扫描与频域增强框架,解决口扫分割中空间连续性与边界定位问题,精度提升1.1%。

04:00
arXiv cs.CV

谁保留,什么改变:身份锚定的复合步态检索

提出复合步态检索新任务,构建首个步态-语言数据集,用身份锚定框架防身份漂移,在两项基准上取得最优结果。

04:00
arXiv cs.CV

FAN-LoRA:用于医学基础模型领域自适应的傅里叶自适应非线性低秩适配器

FAN-LoRA提出频率解耦适配器,样条低通对齐结构,傅里叶高通补偿纹理,跨模态跨中心超越现有微调,Dice提升且边界误差降低。

04:00
arXiv cs.CV

DPA-I2P:面向自动驾驶图像到点云配准的深度引导投影对齐

提出DPA-I2P,采用深度引导投影对齐与跨模态查询剪枝,显著提升图像-点云配准精度。

04:00
arXiv cs.CV

组织混合熵加权重建用于部分容积感知的脑MRI超分辨率

提出组织混合熵加权重建,应对部分容积效应,提升脑磁共振超分辨率,推理仅需低分辨率图。

04:00
arXiv cs.CV

LiveVVT:实时高保真视频虚拟试穿

LiveVVT:滚动流式扩散框架,保持双向建模,实现实时高保真视频试穿,大幅降低延迟并提高吞吐量。

04:00
arXiv cs.CV

船体优先、尾流次之:抑制尾流依赖的鲁棒海事船舶检测

提出船体优先、尾流次之框架,分离船体证据与尾流上下文,抑制尾流主导预测,提升弱无尾流船舶检测鲁棒性。

04:00
arXiv cs.CV

层级通道堆叠:一种用于AI生成图像检测的结构化决策框架

层级通道堆叠将卷积网络激活转为60维分层表示,检测人工智能图像准确率86.7%,并分析层级贡献。

04:00
arXiv cs.CV

CoGeo-GS:概念驱动与几何感知的3D场景多目标移除

提出概念驱动几何感知的三维多目标移除方法,效果优于现有。

04:00
arXiv cs.CV

视网膜眼底图像分类的领域特定自监督表示学习

针对视网膜图像定制增强策略,用SimSiam和SimCLR在有限数据下学习可迁移表示,减少标注依赖,取得竞争性结果。

04:00
arXiv cs.CV

用你之言推理:面向视频大语言模型推理蒸馏的离策略轨迹个人语型改写

提出Echo-GRPO,将教师轨迹改写成学生个人语型,解决策略失配,显著提升视频推理蒸馏性能。

04:00
arXiv cs.CV

AesCanvas:面向美学批评与情境适配的大规模数据集与基准

提出AesCanvas基准,含54,300图的批评数据与301个情境场景,揭示美学批评与情境判断能力分离,专家模型不擅情境适配。

04:00
arXiv cs.CV

PailitaoGR:生成式图像检索中的潜在图像思考

提出PailitaoGR,一种潜在图像思考的生成式图像检索方法,聚焦目标并利用辅助证据,性能平均提升13.8%。

04:00
arXiv cs.CV

RECAP-Forcing:长视频生成中的内容外观保留

该技术按外观新颖性组织记忆,保留新内容缓存,无需训练即提升长视频生成的视觉质量与语义一致性。

04:00
arXiv cs.CV

G2D:零样本图像分类的生成式到判别式协作推理

生成模型可验证CLIP检索候选,通过三叉树约束与熵自适应,提升零样本分类精度,平均准确率达68.85%。

04:00
arXiv cs.CV

参数高效稀疏事件Transformer持续学习

提出sLoTh框架,冻结骨干仅更新<1%参数,实现无回放类增量与在线持续学习,能耗比稠密模型低6.5倍。

04:00
arXiv cs.CV

大型视觉语言模型中的多图像视觉令牌剪枝

提出无训练自适应视觉令牌剪枝(AVTP),按重要性动态分配剪枝率,多图任务提速2倍,精度几乎无损。

04:00
arXiv cs.CV

生成式语义场景补全

提出生成式语义场景补全,用离散扩散统一数据生成、补全与精化,最优mIoU达38.8%。

04:00
arXiv cs.CV

跨架构知识蒸馏:从视觉基础模型到轻量视觉状态空间模型用于茶叶病害分类

DINOv2教师蒸馏至轻量SSM学生,茶叶病害分类准确率提升3.09%,参数减少5倍。

04:00
arXiv cs.CV

基于三维视觉几何的玻璃表面检测

提出基于三维视觉几何的玻璃表面检测法,用频域自注意力与几何接地模块,七项基准最优,提升重建。

04:00
arXiv cs.CV

超越原子布局:基于视觉语言模型的组合设计理解

提出组合布局理解任务与数据集,针对语义漂移和结构歧义提出方法,7B模型达九成多,仅三成数据超越全量微调。

04:00
arXiv cs.CV

环形强制:迈向自回归视频扩散的精确长期记忆

提出环形强制框架,通过环形训练、压缩和稀疏RoPE,实现分钟级视频生成的长时记忆与物体恒常性。

04:00
arXiv cs.CV

GeoMAD:基于可变形融合与分布对齐的几何感知多视图异常检测

提出GeoMAD:可变形融合建立跨视图几何对应,分布对齐保持全局一致性,多视图异常检测性能领先。

04:00
arXiv cs.CV

UniGeo:用于文本引导跨视图地理定位的多模态大语言模型

UniGeo结合地理语义学习、跨视图生成和候选验证,在GeoText-1652上提升文本引导无人机定位精度,R@10和mAP分别提高13.59和2.83个百分点。