11271 条条目 · 106 个活跃源
2026年7月7日
04:00
arXiv cs.CV

旋转注意力:面向视频生成中INT4量化注意力的RoPE感知旋转与范围修正

提出RotateAttention,通过RoPE感知旋转和范围优化量化,实现视频生成中INT4注意力加速,性能近无损,端到端加速1.68倍。

04:00
arXiv cs.CV

CPR:链式感知细化用于由粗到精的医学图像分类

CPR框架通过粗到精的链式感知细化,在恒定内存下提升诊断精度,计算量降低达19.6倍。

04:00
arXiv cs.CV

Homer:利用分层记忆与智能体推理理解长视频

Homer通过分层记忆与智能体推理,实现长视频在线理解,在多个基准上大幅超越现有方法。

04:00
arXiv cs.CV

可靠性感知的CT-MRI配准:含稳定性分析与风险分类的质量工程框架

提出可靠性框架,用阈值将CT-MRI配准质量分为绿/黄/红,仿射优于刚性,Dice为主,实现可解释质量控制。

04:00
arXiv cs.CV

H-OPD:置信度感知的异构多教师多模态在策略蒸馏

H-OPD通过token级仲裁动态结合视觉-语言与纯文本教师,提升多模态推理性能。

04:00
arXiv cs.CV

一种基于深度学习网络损失函数序列的自动识别错误标注图像的方法

利用损失函数序列自动识别错误标注图像,提升数据集质量与模型性能,实验验证有效。

04:00
arXiv cs.CV

CV-DCLR:因果视觉动态标签精炼实现鲁棒零样本学习

提出因果视觉动态标签精炼框架,通过双流互校正与自适应门控解耦语义纠缠,提升零样本学习鲁棒性。

04:00
arXiv cs.CV

令牌级响应-视觉注意力引导用于多模态大语言模型知识蒸馏

揭示响应-视觉注意力对蒸馏关键,提出令牌级注意力引导TRAG自适应加权KL散度,显著提升性能。

04:00
arXiv cs.CV

CIPHER:医疗公平性与鲁棒性的因果干预路径

提出多路径因果干预框架CIPHER,利用扩散模型减少敏感属性差异,降幅达35.8%,提升诊断公平与准确率。

04:00
arXiv cs.CV

评估自主计算病理学的智能框架系统

ACP-Bench评估自主计算病理学智能框架,发现工作流启动与诊断报告成熟,但工具执行和端到端完成仍不足。

04:00
arXiv cs.CV

SE-UNet:面向现实约束生成的奇异等变成像

提出SE-UNet,利用几何等变与奇异值门控,零样本修复80%缺失像素,PSNR超Deep Image Prior 4dB。

04:00
arXiv cs.CV

CLABTOOLKIT:用于神经影像数据常规处理、操作和可视化的开源工具包

CLABTOOLKIT是Python开源工具包,整合神经影像数据(体积、表面、纤维束)的处理与可视化,支持多格式和自定义工作流。

04:00
arXiv cs.CV

BiSLW: 生成扩散模型的双谱潜在水印

BiSLW利用扩散潜力的频率结构进行双带嵌入,提升PSNR超3dB,强鲁棒性,计算开销小。

04:00
arXiv cs.CV

EmoteGPT:基于自然语言描述的三维人体面部表情

提出Txt2Emote基准和EmoteGPT框架,实现从文本到3D表情的精细控制,性能超越现有方法。

04:00
arXiv cs.CV

S-EMBER:大规模流式自我中心记忆检索基准

S-EMBER包含388小时智能眼镜视频和9448个QA对,揭示时间定位是架构瓶颈,无法靠扩大模型规模解决。

04:00
arXiv cs.CV

面向视频推理的潜在视觉缓存

提出Latent-VC方法,在解码器中插入循环潜在视觉缓存,保持视觉记忆,提升视频推理性能,缩短响应长度。

04:00
arXiv cs.CV

K9-Bench:在以犬类为中心的视频上评估多模态大语言模型

新基准K9-Bench测试多模态大模型对犬类视频的理解,发现零样本能力有限,长程推理表现不足。

04:00
arXiv cs.CV

保护隐私的工业人机工程学:基于毫米波的自动REBA评分与姿态估计

提出毫米波雷达端到端框架,实现隐私保护的REBA评分,准确率77.78%,延迟5.70ms。

04:00
arXiv cs.CV

Fusion:视觉Transformer中统一顺序令牌适配框架

Fusion协调令牌合并、早期退出与剪枝,降低计算成本并保持高准确率,校准误差降低4倍,能耗降48%。

04:00
arXiv cs.CV

DynaWM:面向移动物体操作的基于基础VLA引导的世界基础模型

DynaWM通过Mamba-3和V-JEPA编码,条件化流匹配DiT生成动作轨迹,在移动物体操作任务上最高提升45%。

04:00
arXiv cs.CV

基于ViT和堆叠集成的自动多模态青光眼检测框架

提出基于ViT和堆叠集成的多模态框架,在PAPILA数据集上达97.5%准确率,并部署为Web平台。

04:00
arXiv cs.CV

基于核心集的可证明剪枝用于高效3D高斯泼溅

首次为3DGS提供加权核心集构造定理,通过敏感性采样确保可证明近似,在无微调下实现高效压缩。

04:00
arXiv cs.CV

基于条件生成对抗网络的二维图像属性约束三维多孔介质重建

提出cGAN框架,利用2D薄片图像生成孔隙度可控的3D多孔介质,无需3D训练数据,孔隙度R²达0.93。

04:00
arXiv cs.CV

使用深度学习目标检测器的卫星图像飞机检测

提出结合Gabor滤波和YOLOv11的检测框架,卫星图像飞机检测mAP达95%,适用于实时监控。

04:00
arXiv cs.CV

冻结主干网络中分辨率何时起作用?分辨率下的全局注意力预测伪装及海洋动物分割的可扩展适应

全局注意力各向同性ViT随分辨率提升,层次化主干受限。低秩适配中全局注意力关键,SALT方法获伪装与海洋动物分割新SOTA。

04:00
arXiv cs.CV

VLRC:视觉-语言重投影一致性作为可扩展信号用于更好的前馈三维预训练

VLRC利用冻结的视觉-语言表示作为语义多视图监督,无需额外标注即可提升三维重建与零样本语义分割。

04:00
arXiv cs.CV

归一化对象坐标空间中的全局姿态控制用于生成式视图合成

提出在归一化目标坐标空间从无位姿图像精确控制相机,结合图像编辑与文本定义,生成一致朝向的新视图,实现最先进效果。

04:00
arXiv cs.CV

利用基础图像生成模型诊断航拍视角目标检测器

用生成模型构建可控测试集,诊断航拍检测器弱点,定向补充数据可提升AP50达13%。

04:00
arXiv cs.CV

RayTun3R:3D基础模型中的在线相机自适应

提出RayTun3R,仅10752参数通过调整位置编码消除鱼眼偏差,旋转误差降低2-12倍。

04:00
arXiv cs.CV

GRCD:用于多发现胸部X光片对的接地区域变化检测

GRCD提出区域引导变化令牌和双路径策略,生成多发现X光片对接地报告,提升变化检测与临床准确性。

04:00
arXiv cs.CV

Biomechanics-aware Multi-view Markerless Motion Capture of Dexterous Hand Movements

04:00
arXiv cs.CV

来自太空的信号:检测学校和信号塔以弥合数字鸿沟

用卫星图像和迁移学习同时检测学校与信号塔,评估联网情况,助力弥合数字鸿沟。

04:00
arXiv cs.CV

全息字幕:迈向3D场景的文字等价物

提出全息描述任务,通过HoloScribe模型生成3D场景结构化文本,性能优于现有方法。

04:00
arXiv cs.CV

追踪噪声,移动世界:基于3D的运动一致噪声实现可控视频生成

UniCaMo构建3D运动一致噪声空间,无需修改模型即可同时控制物体轨迹和相机视角,经LoRA微调达SOTA。

04:00
arXiv cs.CV

对话式人类视听对话生成

CHAT框架从文本生成成对视听对话,统一大语言模型与说话人脸模型,性能优于现有方法,替代昂贵数据采集。

04:00
arXiv cs.CV

基于多实例融合的可撤销生物特征模板保护:一种对侧虹膜方法

提出无外部密钥的对侧虹膜融合可撤销模板保护,满足ISO标准,实验等错误率低至0.36%,优于未保护方案。

04:00
arXiv cs.CV

视觉语言模型在UML图解释中的先验偏差

VLMs对UML类图存在先验偏差,箭头反转导致开源模型方向准确率平均下降33.48%,GPT系列降幅较小。

04:00
arXiv cs.CV

SPLIT:基于空间补丁级不一致性和时间粗糙度的无需训练AI生成与部分编辑视频检测

提出SPLIT检测器,通过空间补丁级不一致性与时间粗糙度融合,无需训练即可在极低假正率下高效检测AI生成及部分编辑视频。

04:00
arXiv cs.CV

E-TraMamba:基于事件相机的高效长期3D特征跟踪新范式

E-TraMamba首个基于Mamba的事件相机3D特征追踪框架,通过线性状态空间模型高效长程建模,性能SOTA,特征寿命提升2倍以上。

04:00
arXiv cs.CV

ProLaViT:在结构化潜在空间中学习渐进式潜在视觉思维

ProLaViT框架通过内生自蒸馏和两种推理链实现结构化潜在视觉推理,高效准确可解释。

04:00
arXiv cs.CV

MORE:多语言文档解析基准与评估

MORE基准覆盖149种语言,评估结构化文档解析,为低资源语言建立性能基线。

04:00
arXiv cs.CV

R3D:面向自我中心可穿戴设备的定量三维空间推理

提出R3D-Bench基准与R3D框架,在自我中心视频定量3D推理上达73.5%准确率,大幅超越现有方法。

04:00
arXiv cs.CV

利用层次表示正则化学习大型多模态模型的分类树

HiR^2通过分类蕴含和判别分散损失,增强大型多模态模型的层次一致性。

04:00
arXiv cs.CV

STAC:用于视频推理分割的选择性时空聚合与压缩

STAC利用状态空间模型实现上下文感知的高效压缩,减少85%标记并提速1.8倍,零样本流式推理分割性能超无压缩方法。

04:00
arXiv cs.CV

VideoSearcher:通过强化学习实现多工具代理推理,赋能视频深度研究

提出VideoSearcher框架,用强化学习优化多工具推理,实现视频深度研究;新基准VideoSearch-QA显示其性能显著优于现有方法。

04:00
arXiv cs.CV

CL-Anomaly:基于多模态大语言模型的分层自适应混合专家方法用于异常检测的持续学习

提出隔离-共享专家与分层自适应知识迁移,高效实现异常检测持续学习,性能领先。

04:00
arXiv cs.CV

基于池化的上下文建模用于无卷积深度图像先验

提出无卷积Pool-DIP,用池化上下文建模高效去噪,参数少且性能优,可泛化到超分辨率和修补。

04:00
arXiv cs.CV

MatPhaseBench:面向材料相图理解的语义引导基准

MatPhaseBench是面向材料相图的高质量基准,含200个图文对,评估VLM复杂图像理解,发现模型远不及专家水平。

04:00
arXiv cs.CV

ReLo-IRR:反射引导的LoRA图像反射去除框架

提出ReLo-IRR,利用反射强度先验和时间条件LoRA调制,实现自适应反射去除,性能显著。

04:00
arXiv cs.CV

看见情感:面向EEG情感识别的人脸表情符号代理建模

提出将EEG信号转换为匿名表情符号的框架,实现高精度情感识别与可视化,让用户直接“看见情感”。