10991 条条目 · 106 个活跃源
2026年8月21日
04:00
arXiv cs.CV

STEP:基于分数的时间能量用于人体姿态视频异常检测

提出STEP框架,用PCA将姿态序列投影到白化PC空间,避免噪声产生不合理姿态,提升视频异常检测性能。

04:00
arXiv cs.CV

ID-VTG:图像消歧的视频时间定位

提出图像消歧视频时间定位任务,用图文查询定位实例动作,构建基准并验证框架最优。

04:00
arXiv cs.CV

已知光照下基于点的稀疏视图三维重建

提出基于β面元与伴随光传输的稀疏视图重建,仅用267个基元,倒角距离降低28.5%

04:00
arXiv cs.CV

从街景图像到街道质量指标:面向郊区15分钟城市的视觉语言推理

用视觉语言模型分析法国尼斯郊区街景,评估步行友好性,发现优质街道稀缺,展示AI支持大规模城市诊断的潜力。

04:00
arXiv cs.CV

结构化亲和力:深度人工免疫网络中的无监督视觉类增量记忆

深度人工免疫网络利用结构化亲和力与响应图保留,实现无需回放的视觉类增量学习,在数字数据集上达到高准确率与初始类保留。

04:00
arXiv cs.CV

基于仿射或旋转协变特征的重力感知部分标定绝对位姿估计

结合IMU重力与特征几何,提出两种求解器,实现部分标定绝对位姿与焦距联合估计,高效准确。

04:00
arXiv cs.CV

超越蒙版:评估视频物体移除中的因果与物理一致性

提出BeyondMasks基准与CORE协议,发现现有方法虽局部修复好,但常遗漏阴影反射等物理效应,需因果一致评估。

04:00
arXiv cs.CV

HandMvNet:基于多视角交叉注意力融合的实时3D手部姿态估计

HandMvNet用多视角交叉注意力融合,实时估计3D手部姿态形状,无需相机参数,性能优越。

04:00
arXiv cs.CV

ArmorOCR:基于观测迁移自蒸馏的定位式对抗视觉感知

提出对抗OCR定位感知基准AdvSpot及两阶段框架ArmorOCR,用自蒸馏和策略优化增强对抗文本感知,同时保持通用OCR能力。

04:00
arXiv cs.CV

迈向手术世界动作建模:用于手术运动规划的初步联合视觉-轨迹预测

联合预测视觉与轨迹,分块自回归优于一步预测,但长程仍存在视觉退化与轨迹误差累积。

04:00
arXiv cs.CV

G3Ego:基于目光引导图的第一人称动作理解

提出G3Ego,用目光构建动作图并剪除无关实体,时序聚合用于识别/预测,性能好且免昂贵预训练。

04:00
arXiv cs.CV

RoMAN-Flow:驯服自回归归一化流以用于机器人操作中的离线强化学习

提出RoMAN-Flow,用免采样优势加权似然训练自回归流策略,并蒸馏为单步生成器,降低推理延迟,性能媲美现有方法。

04:00
arXiv cs.CV

人工智能在结直肠手术工作流程分析中的应用:一项多中心、跨术式的开发与泛化研究

人工智能模型可靠识别结直肠手术阶段,多中心联合训练泛化性优于中心或术式特定模型,但术式特定步骤识别仍占优。

04:00
arXiv cs.CV

基于相关匹配变换的超高清复原Transformer

提出UHDformer++,基于相关匹配变换与四空间协同,超高清复原参数减86%,在五项任务上显著提升。

04:00
arXiv cs.CV

透镜去畸变:基于物理的视频眼镜移除方法

提出物理模拟与生成先验结合的视频眼镜移除框架,JFSnet保持身份表情,高保真且实时。

04:00
arXiv cs.CV

DPC-Net:面向全合一图像恢复的双先验协作网络

提出双先验协作网络融合退化语义与低级视觉先验实现全合一图像恢复性能领先

04:00
arXiv cs.CV

视觉Transformer训练中的特征演化与迁移

用稀疏自编码器分析ViT特征,发现迁移多发生在训练初期且趋向浅层,深层更早稳定。

04:00
arXiv cs.CV

PelviNeXt:面向女性健康盆腔影像的模态无关混合网络

提出模态无关混合网络PelviNeXt,在PCOS超声和骨盆骨折X光上均超越现有最优,并审计修复了数据集重复污染。

04:00
arXiv cs.CV

提示条件通道注意力:面向解剖无关分割的层级特征调制

提出提示条件通道注意力(PCCA),通过门控激励在编码器-解码器网络中分层融合语义提示,重校准特征,提升医学图像分割性能。

04:00
arXiv cs.CV

4DAnyone:从随意单目视频中创建任意人物的4D模型

提出4DAnyone,从单目视频重建4D人体,用上下文压缩与路由解决多视角一致性问题,效果领先。

04:00
arXiv cs.CV

LF-GICP:基于体素法线可定位性场、无需调参的退化感知激光雷达里程计

用体素法线可定位性场统计和中值门控做无参数退化感知,KITTI平移误差0.865%,跨四类传感器。

04:00
arXiv cs.CV

DreamHand:将视频扩散模型重新用于抗遮挡的自我中心3D手部运动恢复

将视频扩散模型改为确定性几何编码器,单次前向恢复遮挡及离镜手部3D轨迹,多项基准SOTA,误差降低30%-61%。

04:00
arXiv cs.CV

Swift-Image:探索紧凑统一图像生成模型的性能前沿

Swift-Image以6B参数和243K GPU小时实现领先性能,巧用渐进训练与强化学习,压缩至3B几乎无损,少步蒸馏加速编辑。

04:00
arXiv cs.CV

WithEveryone:群体图像生成的统一规划与身份锚定

提出WithEveryone,通过身份标记与布局锚定损失,实现十人群体图像生成,身份相似度升至0.499,复制伪影降至0.055。

04:00
arXiv cs.CV

CalcSeg:面向单堆叠LGE-CMR心肌瘢痕分割的置信度感知3D潜在上下文课程学习

置信度感知课程学习,动态半监督评估样本难度,切片自注意力建模三维上下文,单堆叠LGE-CMR心肌瘢痕分割,优于其他方法。

04:00
arXiv cs.CV

Inter-X++:多模态人-人交互分析综合基准

推出基准Inter-X++,含高保真人-人交互序列与多模态注释;提出统一框架OpenHHI,在生成与感知任务上达最优。

04:00
arXiv cs.CV

基于自演示生成控制的多任务操作VLA微调

利用零样本VLA自演示生成在线交互数据微调,保留先前任务与指令遵循,高效学习新技能,实现多任务操作。

04:00
arXiv cs.CV

用于脉冲Transformer的脉冲局部交互与自适应互补融合

提出脉冲局部交互与自适应互补融合,改善脉冲自注意力的稀疏弱关系,在图像分类、事件识别、语义分割上均获提升。

04:00
arXiv cs.CV

GRACE:面向教育视觉问答的适配器组合与证据感知校准的有依据推理

提出GRACE框架,以适配器组合与证据感知校准优化教育VQA,ScienceQA准确率升至93.1%。

04:00
arXiv cs.CV

OrthoSkillVLA:基于梯度信息技能子空间适配的持续技能学习

针对VLA模型持续技能学习中的灾难性遗忘,通过分离子空间约束与轻量MoE解码器,兼顾旧技能保持与新技能获取。

04:00
arXiv cs.CV

SafeBranch:具身智能体的分支对安全对齐

提出SafeBranch框架,利用环境回滚构造分支对进行安全对齐,在保持任务成功率的同时实现部署时无需评论家的安全执行。

04:00
arXiv cs.CV

你的转身:居家转身角度估计用于帕金森病严重程度评估

基于深度学习,从居家视频提取3D骨架估转身角度,用于帕金森病严重程度评估,首创单目相机居家量化。

04:00
arXiv cs.CV

AsymFeX:对称驱动的跨模态、跨阶段缺血性卒中分割框架

提出对称驱动的两阶段缺血性卒中分割框架:跨半球注意力与特征差异捕获病灶,跨模态阶段通用,性能优越。

04:00
arXiv cs.CV

当说“不”成就更好视频:为教育本位AI内容创作设计双重把关

双重把关(教育者重塑加自动检测)协同拒绝劣质AI内容,提升视频教学质量,证明审慎抵制与生成式AI是伙伴。

04:00
arXiv cs.CV

PVRA:用于机器人装配的逐点关键点投票框架

提出3D关键点模块化学习框架,学习装配依赖,从RGB-D输入推理可操作输出,优于物体中心基线。

04:00
arXiv cs.CV

机器人学习中潜在动作的关键因素

首个潜在动作学习实证:评估41种设计,发现用潜在动作微调视觉语言骨干能强初始化下游学习,真实机器人验证。

04:00
arXiv cs.CV

MOSAIC:客户端特定缺失模态下联邦图像级弱监督肿瘤分割的模态无关频谱对齐

首个模态无关联邦弱监督肿瘤分割框架,频谱原型对齐与精炼网络逼近全监督,Dice达0.84。

04:00
arXiv cs.CV

流偏好优化中的流形漂移:奖励黑客的根源

流匹配偏好优化导致终端样本偏离预训练流形,引发奖励黑客。提出ThermoDPO温度控制目标,锚定偏好样本,加权变体显著提升性能。

04:00
arXiv cs.CV

基于流匹配的PET图像重建

提出基于流匹配的PET重建方法,结合泊松似然与EM预条件,实现更好偏置-方差权衡。

04:00
arXiv cs.CV

视频证据至推理:通过显式证据锚定的高效视频理解

提出证据链框架,解耦感知与推理,以轻量证据模块和强化学习锚定推理,减少幻觉,多基准达最优。

04:00
arXiv cs.CV

用于跨域遥感图像定位的物体感知图匹配网络

提出IRVL328数据集和物体感知图匹配网络,通过双图推理与节点对齐提升跨模态遥感定位性能。

04:00
arXiv cs.CV

XDen-1K:真实世界物体密度场数据集

首个真实物体密度场数据集,含三维模型与X光扫描,提供密度估计基准,助力机器人操作。

04:00
arXiv cs.CV

基于轮廓的步态基础模型

首个可扩展自监督步态预训练框架,跨数据集任务泛化强,零样本识别创新高。

04:00
arXiv cs.CV

YolovN-CBi:面向小型无人机实时检测的轻量高效架构

提出YolovN-CBi架构,融合CBAM与BiFPN,提升小目标检测,蒸馏模型更快更准,适用于实时无人机检测。

04:00
arXiv cs.CV

回归器引导的图像编辑改变社交媒体中的情绪与脱离时机

针对网络过度使用,提出回归器引导图像编辑,扩散法可中性化情绪且不损质量,促使用户更早离开信息流。

04:00
arXiv cs.CV

PhysSFI-Net:物理信息驱动的骨骼与面部交互几何学习预测正颌手术结果

物理信息深度学习网络PhysSFI-Net,精准预测正颌术后软组织变形,全局误差约1毫米,优于现有方法,外部验证稳健。

04:00
arXiv cs.CV

ReynoldsFlow:物理启发的时空流表示用于视频理解

基于雷诺输运定理与亥姆霍兹分解,雷诺流将运动分解为无旋无散,轻量可解释,提升视频理解。

04:00
arXiv cs.CV

解耦高频与低频以实现精细细节的忠实图像生成

提出DeBaT解耦高低频嵌入学习,在保持全局一致时重建精细细节,生成更清晰真实的图像。

04:00
arXiv cs.CV

MambaX-Net:用于纵向前列腺MRI分割的双输入Mamba增强交叉注意力网络

提出新网络,结合前时点影像与掩码,用状态空间增强交叉注意力和形状提取,半监督自训练,纵向前列腺分割更优。

04:00
arXiv cs.CV

OmniCamera:任意相机控制的多任务视频生成统一框架

提出全相机框架,解耦内容与相机运动;用混合数据及双层级课程训练,实现任意控制与高质量生成。