11301 条条目 · 106 个活跃源
2026年7月1日
04:00
arXiv cs.CV

DataEvolver:自我进化的多智能体数据构建方法用于文本丰富图像生成

DataEvolver利用被拒绝样本反馈,自我进化构建文本丰富图像数据,显著提升生成质量。

04:00
arXiv cs.CV

SimpleSearch-VL:多模态智能体深度搜索的简易方案

SimpleSearch-VL通过改进搜索验证过程,实现高效可靠实用的多模态智能体搜索,少量数据即可媲美顶级模型。

04:00
arXiv cs.CV

全自动高精度分割OCT中的视网膜萎缩与椭圆体区厚度:真实世界GA监测的可靠工具

提出全自动深度学习框架,高精度分割OCT中GA生物标志物(RPE/EZ丢失及变薄),Dice达0.88,ICC>0.98,可靠用于真实世界监测。

04:00
arXiv cs.CV

基于双流强化学习的令牌稀疏医学多模态推理

ViToS用双流强化学习裁剪视觉令牌,在医学推理中性能提升超100%,加速推理。

04:00
arXiv cs.CV

DPPE:重新思考基于相机的位置编码以扩展多视图Transformer

提出解耦姿态位置编码(DPPE),解决扩大训练时性能停滞问题,实现稳定长时训练并提升泛化。

04:00
arXiv cs.CV

用于生物特征验证的稀疏性诱导散度损失

提出Q-Margin损失,引入概率化边际,保持α-散度稀疏性,在生物特征验证中性能优异,尤其低假接受率下表现突出,训练高效。

04:00
arXiv cs.CV

学习多视图雷达语义分割的结构一致表示

提出可学习超图与最优传输对齐框架,捕获高阶依赖并融合多视图,提升雷达语义分割精度,在CARRADA和RADIal上分别达63.8%和83.4% mIoU。

04:00
arXiv cs.CV

Preserve the Hard, Regenerate the Rest: Uncertainty-Guided Synthetic Training Data Augmentation with Diffusion Models

04:00
arXiv cs.CV

GUI代理真正需要什么样的记忆?从被动记录到主动任务驱动状态

提出ATMem将GUI代理记忆从被动存储转为主动执行状态,通过STR-GRPO强化学习选择性使用记忆,提升长程任务可靠性。

04:00
arXiv cs.CV

基于多模态代理AI与主动波浪补偿的鲁棒自主无人机海上平台着陆

提出双DRL代理框架,实现无人机海上平台100%着陆成功率,高效稳定甲板水平。

04:00
arXiv cs.CV

LiteMatch:通过代价体稳定化的轻量级零样本立体匹配

LiteMatch以代价体稳定化实现轻量级零样本立体匹配,参数少、泛化强。

04:00
arXiv cs.CV

中文标题:CVPR 2026 RoboSpatial挑战技术报告:面向具身空间推理的选择性推理激活与参考框架消歧

中文摘要:提出RoboSpatialBrain,结合强制推理激活与参考框架重定向,在CVPR 2026挑战中以80.9%成功率夺冠。

04:00
arXiv cs.CV

PrISM-IQA:面向智能手机摄影的实用化图像质量评估

PrISM-IQA提出多问题有序诊断,预测严重级别,实现实用化图像质量评估,支持ISP调优。

04:00
arXiv cs.CV

直方图约束图像生成

提出直方图约束图像生成(HIG),通过最优传输实现精确的分布约束,平衡全局与局部控制,并可嵌入信息。

04:00
arXiv cs.CV

WIDER-FAIR:用于公平性评估的WIDER-FACE数据集标注版本

构建WIDER-FAIR数据集,标注种族性别,发现黑人检测性能低且排除后公平差距增大。

04:00
arXiv cs.CV

SAMBA:面向SAR目标识别的散射引导掩蔽双向Mamba基础模型

SAMBA模型采用线性复杂度的Mamba编码器和散射引导掩蔽策略,在SAR目标识别任务上达SOTA,参数更少。

04:00
arXiv cs.CV

WorldRoamBench:面向交互世界模型长期稳定性的开放世界基准

提出WorldRoamBench基准,从动作、视觉、物理、记忆四维度评估交互世界模型稳定性,测试显示无模型完全达标。

04:00
arXiv cs.CV

ShellMaker:结构约束下的语言引导外部补全

提出语言引导框架,在结构约束下补全建筑外部网格,提升风格一致性。

04:00
arXiv cs.CV

REDI: 面向DINOv3令牌缩减的语料感知补丁排序

REDI结合TF-IDF和注意力图排序补丁,减少46.8%令牌,Top-1达84.706%,超基线。

04:00
arXiv cs.CV

内在稳定的脉冲神经网络:克服无批归一化下的性能障碍

提出IS-SNN架构,用拓扑感知权重标准化和残差连接实现无BN稳定信号,性能媲美动态BN,资源消耗降低96.4%。

04:00
arXiv cs.CV

基于双范围体素表示的语义占用预测

提出双范围体素表示,融合单扫描点云的视角特征,提升预测精度与速度。

04:00
arXiv cs.CV

Phantom:一种具有潜在与空间约束的统一换脸深度伪造防护框架

提出Phantom框架,联合潜在与空间约束,自适应合成目标并施加掩蔽扰动,显著提升换脸深度伪造防护成功率与视觉质量。

04:00
arXiv cs.CV

面向扩散模型遗忘的稀疏自编码器:只看不碰

稀疏自编码器可检测概念,直接干预易致伪影;用无目标嵌入替换目标区域可干净擦除,揭示检测与干预的差距。

2026年6月30日
04:00
arXiv cs.CV

记忆增强LSTM自编码器用于IMU传感器融合的无监督活动识别

提出无监督记忆增强自编码器融合多IMU传感器,短窗内提特征,准确率达96.6%和98.4%

04:00
arXiv cs.CV

GeoISF:实例语义森林启发的大规模跨视角地理定位——基于地面激光雷达到卫星图像

GeoISF利用WordNet构建实例语义森林,提升跨视角定位的语义匹配,性能显著优于现有方法。

04:00
arXiv cs.CV

GPU加速的基于块体倒塌动力学的逆向结构拼合

提出JIP-2框架,利用GPU加速物理引擎与深度学习,从倒塌图像逆向重建原结构,实现自动化拼合。

04:00
arXiv cs.CV

无标签驾驶场景复杂度检测:基于联合嵌入预测架构

利用自监督潜世界模型的时序预测误差,无需标签即可检测驾驶场景复杂度,有效识别安全关键场景。

04:00
arXiv cs.CV

图像自回归生成的数据溯源

提出事后溯源框架,通过生成图像特征模式追踪自回归模型来源,无需修改生成过程。

04:00
arXiv cs.CV

地理空间矢量数据自动质量评估:一种基于空间表征学习的GeoAI方法

提出Topo4Vec框架,通过拓扑模拟和空间表征学习自动检测矢量数据错误,建筑重叠识别准确率达0.99,街道网络缺陷达0.60,实现可扩展质量监控。

04:00
arXiv cs.CV

RADIANT-PET:基于大语言模型和强化学习的推理增强型PET/CT病变分割

RADIANT-PET利用大语言模型推理与强化学习,抑制生理性假阳性,显著提升PET/CT病变分割精度。

04:00
arXiv cs.CV

SoccerNet 2026 以球员为中心的球类动作识别:基于一致性集成的单球员注意力机制

提出两阶段流水线,优化时空注意力与加权集成融合,宏F1从48.6提升至58.94。

04:00
arXiv cs.CV

少类保真度:通过优化扰动评估真实条件下CNN分类器的解释

提出面向少类场景的保真度评估指标,用优化扰动测量XAI可靠性,揭示领域与解释方法关联。

04:00
arXiv cs.CV

面向纵向胸部X光报告的过渡感知最佳N采样

提出过渡感知最佳N采样,无需训练,通过集合间距离编码变化,用于纵向胸部X光报告生成,性能优于随机选择。

04:00
arXiv cs.CV

AEGIS:面向视觉传感器的鲁棒对抗检测的语义GAN与证据学习框架

提出AEGIS框架,结合语义GAN与证据学习,在Tiny ImageNet上AUROC达92.1%,优于传统检测方法。

04:00
arXiv cs.CV

JASPR:组织学与空间基因组学的联合空间表征学习,用于改进虚拟基因组筛选和临床预后

JASPR框架通过跨模态重建学习组织学与空间基因组学的联合空间表征,提升乳腺癌基因预测和预后能力。

04:00
arXiv cs.CV

RadarTwin:面向移动式室内感知的场景特定毫米波雷达模拟与学习

基于3D重建与视觉语言模型合成雷达训练数据,零样本识别达2.5倍概率,少量标注达95.3%。

04:00
arXiv cs.CV

CLOSER-VLN:用于空中视觉语言导航的闭环自验证检索增强推理

提出闭环自验证检索增强推理方法,无需训练策略,有效减少空中导航累积误差,在CityNav上提升性能。

04:00
arXiv cs.CV

视觉驱动的偏好合成以缓解VLM幻觉

ViPSy框架利用视觉线索构建偏好数据,显著降低VLM幻觉率,提升视觉能力。

04:00
arXiv cs.CV

使用关键相关层注意力增强层间交互

KCLA通过关键相关机制实现线性复杂度,保持动态更新和跨层连接,提升多种视觉任务性能。

04:00
arXiv cs.CV

元学习作为类人视觉表征的原理

元学习无需人类数据,训练的表征即能预测人类相似性、语义规则和高级视觉皮层,体现快速学习新语义关系的需求。

04:00
arXiv cs.CV

面向资源受限视觉物联网系统的语义感知生成式图像传输

提出语义感知生成式图像传输框架,在0.074bpp下以44.6%比特达到29.9dB PSNR,优于DeepJSCC/WITT。

04:00
arXiv cs.CV

DCSNet:用于医学小目标分割的检测引导分层裁剪与多尺度特征聚合

DCSNet通过检测引导裁剪与多尺度特征聚合,解决医学小目标分割的类别不平衡和边界模糊问题,显著提升精度。

04:00
arXiv cs.CV

RSGPNet:用于遥感开放词汇语义分割的几何提示

提出无需训练的几何提示框架RSGPNet,利用几何区域和一致性约束优化分割,显著提升遥感复杂区域精度。

04:00
arXiv cs.CV

MedDiffuseMix:利用显著性感知扩散模型保留诊断证据的医学图像数据增强

提出显著性引导扩散混合框架,对低重要性区域进行增强,保留诊断证据,提升分类性能。

04:00
arXiv cs.CV

SatSplat:面向卫星影像的几何精确高斯泼溅法

提出SatSplat框架,用2DGS与在线相机调整,处理光照变化,几何精度高,MAE降11.93%,显存降31%。

04:00
arXiv cs.CV

DiffRGD: 通过黎曼梯度下降的推理时扩散引导

DiffRGD通过黎曼梯度下降保持潜在高斯分布,实现推理时引导,无需重训,提升图像恢复与条件生成性能。

04:00
arXiv cs.CV

基于反事实视觉基础不确定性检测LVLMs中的临床幻觉

通过反事实实体扰动对比事实与反事实定位结果,检测LVLM幻觉,提升性能并提供可解释定位。

04:00
arXiv cs.CV

JuZhou 1.0技术报告:首个完全在中国自主研发AI加速器上训练的、原生于边缘设备的文生图基础模型

JuZhou 1.0是首个纯国产AI加速器训练的轻量边缘文生图模型,0.387B参数,4步推理1.6秒,GenEval 0.69超SDXL。

04:00
arXiv cs.CV

CLEAR-MoE:通过校准驱动层选择从冻结视觉Transformer中提取共享基专家

CLEAR-MoE将冻结ViT转为MoE,共享SVD基保持99.9%精度,路由几乎不影响性能。

04:00
arXiv cs.CV

MammoFlow:基于解剖一致性流匹配的多视角乳腺X光图像合成

提出MammoFlow,利用视角几何关系与对齐模块生成物理一致的多视角乳腺图像,提升分类AUC 5%。