10991 条条目 · 106 个活跃源
2026年8月21日
04:00
arXiv cs.CV

OP3DSG:面向真实世界环境的开放词汇部件感知三维场景图生成

提出开放词汇部件感知三维场景图框架,融合部件与关系建模,引入新基准,实现最优性能。

04:00
arXiv cs.CV

解读像素:针对文本到图像模型的铭刻式越狱攻击

提出Etch:分解提示词实现铭刻式越狱,让T2I生成含恶意文本的图像,成功率65.57%,揭示安全盲区。

04:00
arXiv cs.CV

4DLoG:基于4D纵向扩散模型的神经退行性脑解剖生成建模

提出4DLoG,一种4D纵向扩散生成框架,联合建模时空依赖与形变,生成个体脑轨迹,优于基线。

04:00
arXiv cs.CV

通过结构补全与运动矫正实现功能化

提出物体功能化任务,用功能图补全修复3D模型缺失结构并矫正运动,提升碰撞与连接功能性。

04:00
arXiv cs.CV

SwipeGen:通过类人滑动合成弥合GUI智能体的执行鸿沟

针对滑动执行僵化,提出SwipeGen合成类人滑动与SwipeBench基准,成功率提升2.46倍。

04:00
arXiv cs.CV

自监督学习至关重要:微手势识别的简单集成方案

自监督RGB加监督多流集成,在iMiGUE达74.419%准确率,超先前最优1.206%,验证其有效性。

04:00
arXiv cs.CV

扩展至现实:3D环境中的提示注入

提出PI3D攻击,通过放置文本物体劫持3D环境中的多模态大模型,现有防御不足。

04:00
arXiv cs.CV

UrbanVGGT:基于街景图像的可扩展人行道宽度估计

提出UrbanVGGT,从单张街景图像估计人行道宽度,平均误差0.252米,尺度校准为关键,支持城市级扩展。

04:00
arXiv cs.CV

基于无人机的基础设施检测:AEC+FM文献综述与拟议框架

综述一百五十余项研究,提出融合光学、雷达、热成像与自注意力模型的无人机检测框架,精准识别结构、热力与几何异常。

04:00
arXiv cs.CV

面向视障人士的文本驱动触觉图形生成

首次实现从文本直接生成可3D打印的2.5D触觉图形,含精细纹理与盲文,获用户偏好。

04:00
arXiv cs.CV

PosterText:面向电商海报的统一视觉文本生成与编辑

提出文本补丁生成与编辑的统一任务,构建模型实现电商海报生成与灵活编辑,性能优异。

04:00
arXiv cs.CV

松弛参数优化损失函数的引导扩散逆向材料设计

提出扩散模型逆向设计法,松弛参数空间引导采样,2D/3D中生成匹配体积模量的多样方案,误差1%内。

04:00
arXiv cs.CV

神经先验估计:从潜在表示学习类别先验

提出神经先验估计器,从潜在表示学习类别先验并修正逻辑,缓解长尾不平衡,提升少数类性能。

04:00
arXiv cs.CV

MinerU.Chem:高精度的光学化学结构与反应识别系统

有机化学文献解析系统,可把结构图转为分子与反应列表,SMILES识别准确率达93.02%。

04:00
arXiv cs.CV

利用完整性感知与扩散Transformer实现统一3D MRI合成

提出CoPeDiT,通过完整性感知提示词引导扩散Transformer合成缺失3D MRI,超越现有方法。

04:00
arXiv cs.CV

FermatSyn:SAM2增强的双向Mamba结合各向同性螺旋扫描用于多模态医学图像合成

FermatSyn:SAM2增强双向Mamba螺旋扫描,多模态合成超SOTA,临床分割验证有效。

04:00
arXiv cs.CV

通过空间掩码与通道融合的深度多模态融合检测

提出注意力驱动互补重采样框架,结合语义掩码交换与通道竞争,提升跨模态检测性能。

04:00
arXiv cs.CV

HarmoHOI:协调外观与三维运动的多视角手物交互合成

提出统一扩散框架,协同生成多视角手物交互视频与三维轨迹,兼顾外观与运动一致性,性能领先。

04:00
arXiv cs.CV

SoftVTBench:物理约束下可变形物体机器人操作的安全感知视触觉基准(早期版本)

提出安全感知视触觉基准,区分目标成功与安全成功;实验显示仅看成功率高估性能,引入触觉可提升安全成功率。

04:00
arXiv cs.CV

基于建模局部误差统计,从MSE估计DCT压缩图像的SSIM

用参考图像局部方差/标准差加权分配全局MSE来近似SSIM,无需局部MSE,优于全局基线,可扩展视频。

2026年8月20日
04:00
arXiv cs.CV

可配置隐私保护MRI处理流程:基于深度学习脑提取与自适应解剖保留

提出可配置隐私保护MRI流程,结合深度学习脑提取、自适应解剖保留与质量控制,提供交互式配置,平衡隐私与解剖信息。

04:00
arXiv cs.CV

光学显微图像中X射线荧光图谱的采集几何辅助整组定位

利用采集几何约束整组定位XRF图块,显著提升定位精度(GroupIoU达0.931/0.856)。

04:00
arXiv cs.CV

视觉提示引导的野生动物个体级识别

提出单阶段检测与再识别模型,用视觉提示增强查询,mAP 30.584% vs 两阶段44.89%

04:00
arXiv cs.CV

FedCoRe:医疗联邦学习中缺失模态的目标自适应补全

FedCoRe通过配对样本学习表征或逻辑空间修正,无需生成合成数据,在MIMIC任务中恢复缺失ECG性能49%,缺失CXR恢复52.8%,但仅限有验证支持的场景部署。

04:00
arXiv cs.CV

基于视觉语言模型的XRF到光学视场定位

评估免训练视觉语言模型在XRF与光学图像视场定位中的效果,提出提案-验证流程,能在低对应场景下恢复定位。

04:00
arXiv cs.CV

基础模型时代的人类中心智能综述

提出全谱人类情境分类法,综述六个层级方法、数据集与挑战,为人类中心智能提供统一框架。

04:00
arXiv cs.CV

LumiTokens:通过令牌空间光照变换实现3D重光照

提出在令牌空间直接进行光照变换实现3D重光照,无需显式三维表征或物理分解,支持逐光源渐进组合编辑。

04:00
arXiv cs.CV

高通量免计数单光子3D相机

针对单光子相机高通量下堆积失真与数据瓶颈,提出自由运行采集与分析合成重建,实现宽光照可靠深度与反射率成像。

04:00
arXiv cs.CV

临床域偏移下多器官CT分割的界限感知逐器官召回风险控制

临床域偏移下,逐器官召回风险控制:迁移后7/12超限;WSR边界25例重认证6个一级器官,优于HB。

04:00
arXiv cs.CV

跨GelSight Mini传感器的力图估计零样本迁移

跨GelSight Mini传感器零样本力图估计:先重建统一触觉图,再用U-Net回归3D力。

04:00
arXiv cs.CV

注意力迁移到底迁移了什么?视觉Transformer中的注意力结构与鲁棒性

注意力蒸馏近乎完美且稳定,但鲁棒性差距源于训练不充分,非注意力结构本身。

04:00
arXiv cs.CV

从推理到适配:视觉语言模型的统一最优传输视角

提出统一最优传输框架,用Wasserstein距离生成稳健伪标签,结合软标签InfoNCE损失,统一推理与适配目标,性能提升达7%。

04:00
arXiv cs.CV

可复现的多模态可供性预测

提出可供性清单规范,涵盖任务、模型、数据与实验协议,促进可复现的多模态可供性预测评估。

04:00
arXiv cs.CV

DyG$^2$T:利用3D高斯时空粒子图Transformer建模物体动态

提出DyG$^2$T,通过空间补全与时间判别关键点表示,并在粒子图上建模多尺度交互,实现精准物体动态预测,具良好泛化性。

04:00
arXiv cs.CV

CoMVS-GS:协同多视图立体与3D高斯泼溅的表面重建方法

提出CoMVS-GS,融合多视图立体与高斯泼溅,借助PatchMatch互监督及Delaunay网格剖切,提升弱观测与遮挡区域的重建精度与网格质量。

04:00
arXiv cs.CV

TTSD-FAR:面向LVLM缺失模态情绪识别的测试时自蒸馏与Fisher锚定恢复

TTSD-FAR:冻结教师自蒸馏指导低秩学生,Fisher锚定监测漂移并恢复,适应任意缺失模态,长期稳定且优于基线。

04:00
arXiv cs.CV

JSL-DC:带语言学家易混淆描述的词级日语手语数据集

推出最大日语手语数据集JSL-DC,含19位聋人36.7K视频,提供易混淆描述,识别准确率提升9.8%。

04:00
arXiv cs.CV

深度任意V4:基于4D高斯溅射上的黎曼流匹配实现动态4D场景重建

提出DAV4,将黎曼流匹配应用于4D高斯溅射,实现动态4D场景重建,F值提升0.044,无需人工深度标签。

04:00
arXiv cs.CV

划分支撑集,重构残差:面向视频生成与世界模型的无训练稀疏注意力

提出SparsePR:响应耦合划分与探针拟合残差重建,降低重建误差,在22-26%密度下实现1.48-2.61倍加速。

04:00
arXiv cs.CV

COSTA:面向域偏移航空点云的无标注开放集语义分割的聚类中心范式

COSTA聚类中心范式实现航空点云无标注开放集分割,测试时适应域偏移,跨域mIoU达70.09%。

04:00
arXiv cs.CV

FD-CanKD:面向紧凑目标检测器的频率解耦交叉注意力蒸馏细化先验

FD-CanKD以三级知识蒸馏提升紧凑检测器,精调20轮后mAP达48.87,且不增加部署参数。

04:00
arXiv cs.CV

基于非配对TVUS原型先验的子宫内膜异位症跨模态MRI卵巢分割

针对子宫内膜异位症MRI卵巢分割,提出双分支框架,用TVUS原型先验对齐跨模态特征,性能提升超5个百分点。

04:00
arXiv cs.CV

OptiModNet:用于视盘和视杯分割的UNet-Transformer混合架构,融合分组查询与通道注意力

轻量级OptiModNet融合多种注意力与金字塔损失,REFUGE2上视盘视杯分割超现有方法2.5%,仅3.73GFLOPs和1.93M参数。

04:00
arXiv cs.CV

先验条件高斯判别用于可泛化的AI生成图像检测

提出先验条件高斯判别阶梯,在39数据集710万图像上媲美甚至超越现有检测头,并揭示训练先验等影响。

04:00
arXiv cs.CV

PATE-Forensics:感知即工具——面向通用多模态大模型的可解释深度伪造取证

提出感知即工具范式,解耦检测定位与解释;工具输出取证上下文,供通用多模态大模型解释,免微调,以0.89最佳分居首。

04:00
arXiv cs.CV

StateTrace:一种面向长视频隐藏状态时空推理的对象中心框架

提出状态追踪框架,以对象为中心,构建时空状态记忆与HSR基准,解决长视频隐藏状态推理,性能大幅提升。

04:00
arXiv cs.CV

MR-IQA-2:基于细粒度信用分配的忠实图像质量反映

提出演员-编辑-评判框架,细粒度分离推理与评分监督,使盲图像质量评估更忠实可靠。

04:00
arXiv cs.CV

零样本SAM2分割与基于视觉变换器的退化泥板埃兰楔形文字符号识别

提出分割引导变换器方法,零样本SAM2分割加微调ViT识别退化泥板楔形符号,准确率86.41优于CNN。

04:00
arXiv cs.CV

OmniHandwritingOCR:评估多模态大语言模型在手写OCR场景中的诊断基准

提出OmniHandwritingOCR基准,覆盖手写文本与数学公式,评测13种系统,结果显示现有模型在多行公式上性能骤降且存在幻觉。

04:00
arXiv cs.CV

SPARC:面向分布偏移工业异常检测的子空间位置感知鲁棒少样本校准

SPARC逐单元子空间投影少样本校准,无需梯度,7种检测器AUROC+13.8,AU-PRO+3.5