11301 条条目 · 106 个活跃源
2026年6月25日
04:00
arXiv cs.CV

基于自动标注的域迁移用于自行车搭载LiDAR平台的三维目标检测

利用自动标注实现车辆到自行车平台的域迁移,微调后mAP提升23.4点,自动标签可替代人工标注。

04:00
arXiv cs.CV

联合稀疏自编码器引导视觉-语言模型

提出联合稀疏自编码器(JSAE),对齐约束分解跨模态特征,实现可控干预,优于无约束方法。

04:00
arXiv cs.CV

Towards a Dynamic and Fixed-budget Memory Bank for Efficient Streaming Video Understanding

04:00
arXiv cs.CV

使用奇异值分解的移变图像退化与复原

基于SVD恢复移变运动模糊图像,通过能量保留准则控制噪声,有效恢复细节减少模糊。

04:00
arXiv cs.CV

OracleAnalyser:通过后训练的多模态大语言模型分析甲骨文隐含语义

提出OracleAnalyser框架,后训练微调模型并引入SFPO算法,仅3B参数在甲骨文分析上超越大模型。

04:00
arXiv cs.CV

自然性预测而非导致现实世界流数据图像编码的迁移性

自然性(FID)可预测迁移准确率,但因果干预表明非直接原因,局部结构才是中介因素。

04:00
arXiv cs.CV

Edges Before Embeddings: A Confidence-Aware Blur Gate for Vision-Language Pipelines

04:00
arXiv cs.CV

使用ROI重思考与合成数据增强脑部MRI异常检测与推理

提出BrReMark框架,通过显式区域标记与假设-验证机制,结合强化学习和合成数据,提升脑MRI异常检测的定位精度与诊断可靠性,减少幻觉。

04:00
arXiv cs.CV

先画图!通过场景图实现长时自我中心视频推理

用自我中心场景图压缩长视频为紧凑文本,保留时空信息,突破MLLM输入限制,实现高效推理并达SOTA

04:00
arXiv cs.CV

USS: Unified Spatial-Semantic Prompts for Embodied Visual Tracking with Latent Dynamics Learning

04:00
arXiv cs.CV

ShutterMuse: 基于MLLM的拍摄时摄影指导

提出CaptureGuide-Bench评估MLLM拍摄指导能力,构建数据集和ShutterMuse模型,实现高效摄影指导。

04:00
arXiv cs.CV

$S^{2}$-FracMix: 标签保持的自显著混合增强

结合自显著混合与分形混合,单图像内实现尺度不变和结构一致增强,多项任务达最优。

04:00
arXiv cs.CV

SurgAtlas:大规模手术视频-语言数据集,涵盖2391小时开放与微创手术

SurgAtlas是最大手术视频语言数据集,含2391小时开放与微创视频,提供多样注释及专家验证子集,推动手术基础模型训练。

04:00
arXiv cs.CV

面向水下图像中海洋物种层次分类的分类感知深度学习

提出分类感知框架,结合加权损失与贝叶斯推理,在79类数据集上达1.581分类距离,接近最优,优势在于度量对齐与解耦组件。

04:00
arXiv cs.CV

基于物理信息神经网络的自监督学习的激光焊接熔透预测模型

提出SimPhysNet,利用自监督学习与物理信息神经网络,仅用200张标记图像即达96.06%熔透预测准确率,媲美全监督方法。

04:00
arXiv cs.CV

TriViewBench:面向MLLMs的多视图结构化推理的受控复杂度扩展

TriViewBench评估18个MLLM,发现性能按局部决策、目标计数、全局恢复递减,CoT无效,瓶颈在跨视图表示。

04:00
arXiv cs.CV

MIMFlow:融合掩码图像建模与归一化流的端到端图像生成

MIMFlow通过解耦语义与高频合成解决归一化流容量瓶颈,用更少token实现高精度和低FID。

04:00
arXiv cs.CV

域穿梭:开放域主题驱动的自由形式文本到视频生成

提出DomainShuttle方法,通过域感知MoT、双RoPE和跨对一致性损失,实现开放域主题驱动视频生成的高保真与灵活性。

04:00
arXiv cs.CV

从稀疏不完美的2D锚点到一致的3D高斯街景:支持感知外观

提出支持感知残差蒸馏,将稀疏锚点优化为一致3D高斯场景,抑制噪声并保持跨视图一致性。

04:00
arXiv cs.CV

基于上下文的区域拖拽:将任意区域拖拽至任意形状

提出ICRDrag方法,通过双重注意力正则化实现区域拖拽编辑,构建大型数据集,效果显著优于现有方法。

04:00
arXiv cs.CV

FunPiQ:眼底图像像素级质量评估新基准

提出FunPiQ像素级质量标注基准及EFIQA-CP可解释方法,利用解剖可见性伪标签训练,性能优于现有方法。

04:00
arXiv cs.CV

肺栓塞风险分层:CTPA与医疗记录并用时,血管图并非万能

医疗记录和心脏生物标志物是肺栓塞风险分层关键,血管图及图神经网络未能提升性能。

04:00
arXiv cs.CV

基于物理与极线约束交叉注意力的异构立体去模糊基准

提出异构立体去模糊基准HSD与PECA模块,用物理极线约束实现高效跨视图融合,显著提升去模糊性能。

04:00
arXiv cs.CV

面向机器人视觉检测的低数据空间缺陷检测的混合光电神经网络软硬件一体化设计

提出混合光电神经网络软硬件架构,采用非成像低数据范式、压缩感知与CLIP引导,减少90%数据量并保持检测精度。

04:00
arXiv cs.CV

MVTrack4Gen:多视角点跟踪作为4D视频生成的几何监督

MVTrack4Gen以多视角点跟踪为监督信号,增强运动一致性,提升新视角视频生成的几何保真度。

04:00
arXiv cs.CV

基于无监督域自适应的跨工艺激光与TIG焊接熔透状态预测算法

提出无监督域自适应框架,跨工艺熔透预测准确率达80%以上,显著降低新工艺重标注成本。

04:00
arXiv cs.CV

TryOnCrafter:通过可渲染4D试穿代理释放相机轨迹,实现逼真的视频虚拟试穿

提出相机可控视频虚拟试穿任务及TryOnCrafter框架,通过4D代理解耦人体与环境,实现任意视角的逼真合成。

04:00
arXiv cs.CV

ADM-Fusion:面向多样环境下鲁棒自运动估计的自适应深度多传感器融合

提出ADM-Fusion自适应融合方法,用混合专家框架动态分配权重,结合分离分支与跨任务注意力,在退化环境中保持鲁棒性。

04:00
arXiv cs.CV

面向第一视角视觉理解中具有双重正确预测的低延迟视觉语言模型

提出理由信息剪枝策略,在低延迟VLM中同时提升准确性与证据可靠性,实现双重正确预测。

04:00
arXiv cs.CV

泄漏感知的机器学习、深度学习与Transformer模型在可靠白血病检测中的比较基准

研究发现C-NMC 2019数据集因患者级数据泄漏导致性能虚高,采用受试者不相交协议后EfficientNet-B1最优(AUROC 0.913),随机分割可夸大AUROC约0.04。

04:00
arXiv cs.CV

fARfetch: 利用VLM驱动的AR内容自适应在大型视觉多样性环境中实现共置人机协作

fARfetch系统利用VLM驱动的AR内容自适应,在大型室外环境显著提升人机协作效率并降低工作负荷。

04:00
arXiv cs.CV

用于隐私保护视觉的同态加密

本项目使用全同态加密实现隐私保护的CNN图像分类,精度损失极小,并支持多通道输入、多层卷积和平均池化。

04:00
arXiv cs.CV

半监督胎儿超声分割的双一致性协议学习

提出DACL框架,通过双一致性损失和插值增强,在仅5%标注数据下显著提升胎儿超声分割精度。

04:00
arXiv cs.CV

中文标题:FPGA上基于MSDF数字串行算术的节能CNN加速

中文摘要:提出合并乘加(MMA)架构克服MSDF初始延迟,FPGA加速U-Net,能效达15.14 GOPS/W,较CPU提升约10倍,能耗较MSDF降低9倍。

04:00
arXiv cs.CV

交叉注意力多模态学习预测胃肠道间质瘤新辅助伊马替尼治疗反应:一项多中心回顾性研究

交叉注意力模型整合CT与临床数据预测GIST对伊马替尼反应,内部AUC达0.99但外部泛化受限,揭示反应者与非反应者关键特征差异。

04:00
arXiv cs.CV

面向机器人控制的上下文世界建模

ICWM通过短历史交互推断系统变量,无需参数更新即可适应新配置,显著提升新型相机视角下的泛化能力。

04:00
arXiv cs.CV

基于混合深度学习的相位差异波前重建方法

混合CNN与L-BFGS的波前重建法,快速精确校准自适应光学:模拟效率0.99,实验0.75,2-4次迭代达Strehl比0.96。

04:00
arXiv cs.CV

1000个回合:用于机器人乒乓球的事件相机数据集与实时球状态学习估计

首个超千回合事件相机乒乓球数据集,训练CNN联合估计球位置与速度,结合卡尔曼滤波降低弹跳预测误差36%,实现实时人机对打。

04:00
arXiv cs.CV

DSP-SLAM++:野外多类高保真目标SLAM统一框架

异步建图流水线实现实时多类高保真目标SLAM,延迟降低70%,适用于鱼眼-激光雷达平台。

04:00
arXiv cs.CV

基于纯旋转的非重叠多相机系统外参数标定(卡鲁塞尔法)

利用纯旋转和单标定板,通过潜转台框架全局优化,实现非重叠多相机高精度易部署的外参标定。

04:00
arXiv cs.CV

ASSCG:自动驾驶中快慢LLM规划的恰到好处门控(应对频繁调用)

ASSCG自适应门控(帧级查询/缓存/丢弃)在两种架构上分别提升评分2.28并降延迟60%,或提升PDMS0.6并提速25%。

04:00
arXiv cs.CV

AISPO:通过仿射不变形状先验增强非朗伯体机器人操作的深度可靠性

提出AISPO框架,利用仿射不变形状先验提升深度补全可靠性,显著提高非朗伯体物体抓取成功率。

04:00
arXiv cs.CV

跨体机器人操作中的动作先验学习

提出两阶段框架,预训练动作模块的运动先验,提升跨实体VLA模型收敛速度与成功率。

04:00
arXiv cs.CV

FedReLa: 通过重标签实现非平衡联邦学习

FedReLa通过重标签校正决策边界,无需全局分布知识,提升少数类精度和整体准确率。

04:00
arXiv cs.CV

长尾扩散模型的对比条件-无条件对齐

提出对比条件-无条件对齐方法,通过对齐损失和对比损失改善尾部类图像的多样性与保真度。

04:00
arXiv cs.CV

SparseGS:基于3D高斯溅射的稀疏视角合成

SparseGS引入深度先验与正则化,解决稀疏视角下的伪影和背景崩溃,仅需少量图像即可高质量重建。

04:00
arXiv cs.CV

RoboAtlas:上下文感知主动SLAM

RoboAtlas通过3D语义映射平衡探索与语义推理,在超1800㎡真实场景达100%成功率,基准测试刷新纪录。

04:00
arXiv cs.CV

通过配对图像域检索和文本域增强提升3D脑部MRI报告生成的事实性

提出PIRTA框架,检索相似3D MRI及配对报告,避免直接对齐,提升报告事实性,优于基线。

04:00
arXiv cs.CV

GeoRanker:面向全球图像地理定位的距离感知排序

提出距离感知排序框架GeoRanker,利用大视觉语言模型与多阶距离损失,实现全球图像地理定位SOTA。

04:00
arXiv cs.CV

一种改进的图像去噪变分方法

提出MixTV模型,有效去除多种噪声,唯一解且收敛,去噪质量优于传统TV。