通过全局几何感知扩散过程增强水下光场图像
提出GeoDiff-LF扩散框架,利用几何引导增强水下光场成像,有效减轻颜色失真,性能领先。
伪装感知中面向测试时自适应的层次一致性学习
提出层次一致性学习框架,通过特征重建、任务亲和引导和原型校准,实现伪装目标检测的测试时自适应,提升鲁棒性。
薛定谔的导航器:为零样本物体导航构想未来集合
薛定谔导航器通过推理时想象多种3D未来,聚合想象未来进行鲁棒动作选择,在遮挡场景中提升零样本物体导航性能。
面向渲染的稀疏采样用于BRDF获取
提出渲染感知的稀疏自适应采样方法,优化测量位置以提升极稀疏BRDF获取的渲染外观质量。
无瓶颈统一多模态模型的表示强制
提出表示强制技术,使统一多模态模型无需VAE瓶颈,通过预测视觉表示中间token,同时提升理解与生成性能。
ADAPT:建筑工地自主叉车
一种用于建筑工地的全自动越野叉车ADAPT,集成AI感知与决策控制,实测性能接近人类操作员。
通过区域脑专家的多模态融合实现可解释的阿尔茨海默病诊断
提出MREF-AD模型,利用多模态区域专家融合与门控网络,实现可解释的阿尔茨海默病诊断,性能优异。
MCR-VQGAN:一种用于阿尔茨海默病成像的可扩展且经济高效的tau PET合成方法
MCR-VQGAN从T1-MRI合成高保真tau PET,性能优于多个模型,诊断特征保留且区域一致性高,是传统PET的可行替代方案。
Relational Retrieval: Leveraging Known-Novel Interactions for Generalized Category Discovery
SAFformer:通过主动预测滤波改进脉冲Transformer
提出基于主动预测滤波的脉冲Transformer,抑制冗余聚焦显著特征,在CIFAR/ImageNet上实现高效高精度。
Stream3D:基于证据记忆的序列多视角三维生成
提出Stream3D,以证据记忆实现无训练流式多视角3D生成,保持时空一致性,优于现有方法。
在人工智能辅助的放疗流程中捕获磁共振异常:基于深度学习的无监督图像异常检测与定位
提出无监督框架检测盆腔和脑MRI异常,AUC达0.97和0.81,热图定位准确,可作为放疗自动质量控制层。
一个务实的VLA基础模型
LingBot-VLA基于2万小时数据,三平台100任务表现领先,8GPU吞吐261样本/秒,比现有框架快1.5-2.8倍。
SMART: 基于Transformer的替代模型实现原始几何体可扩展无网格空气动力学模拟
提出SMART模型,仅用点云几何预测物理量,无需仿真网格,性能优于依赖网格的方法。
使用深度神经网络生成最大蛇形多联骨牌
深度扩散模型生成最大蛇形多联骨牌,可泛化至大矩形,但存在分支循环错误。
VLADriveBench:评估自动驾驶视觉-语言-动作模型中推理与动作的关系
VLADriveBench通过观测指标和干预协议,揭示不同VLA模型中推理与动作的因果关系差异。
基于AMD Kria K26 SOM的人体姿态估计立体视觉跌倒预测与检测
提出基于K26 SOM的低功耗立体视觉跌倒检测系统,采用HPE流水线实现隐私保护,准确率75.85%,吞吐量4.5 FPS。
分析并改进医学大视觉语言模型中的细粒度偏好优化
采用双向token级KL正则化和视觉对比约束,构建细粒度对齐框架,提升医学LVLMs临床准确性。
HairPort:上下文感知的三维发型导入与迁移
HairPort通过分离去除与迁移、3D感知流水线,实现大视角差异下高保真发型迁移。
通过教师对齐的端到端蒸馏实现高保真两步图像生成
提出三步设计实现两步图像生成,大幅缩小与八步生成的质量差距。
ECA:面向开放式图像到文本生成的高效持续对齐
提出免样本增量学习方法ECA,通过MoQ、FeDEx和DR机制缓解灾难性遗忘,提升图像到文本生成的持续对齐性能。
面向自动驾驶中共现目标检测的上下文感知特征融合
提出CCFF框架,融合局部与全局上下文特征,有效提升自动驾驶中共现目标与小目标检测性能。
CD-RCM:面向反射共聚焦显微镜的可泛化连续深度新视角合成
提出首个RCM专用新视角合成方法CD-RCM,插值稀疏z-stack实现各向同性体积,支持任意方向切片,亚秒级高保真推理。
双状态槽位注意力:解耦外观与身份以实现视频以对象为中心的学习
DSSA分离外观与身份状态,竞争调节聚合抑制弱匹配槽位,提升视频对象分割与时间一致性。
SalArt-VQA:诊断视觉语言模型是否理解生成图像中的显著伪影
SalArt-VQA基准揭示VLM对生成图像伪影的细粒度理解缺陷,高检测率不代表真正理解。
YOLO-AMC:一种带有注意力机制的改进YOLO架构用于建筑物裂缝检测
提出YOLO-AMC,引入多注意力机制提升裂缝检测精度,[email protected]达0.9917,优于YOLOv11/v8,兼顾速度与效率。
GRIP: 面向大型多模态模型的反馈引导式提示检索
GRIP利用大模型反馈对比训练,优选有效示例提升多模态上下文学习,优于相似度检索并支持跨模型迁移。
DIMOS:解耦实例级移动对象分割
提出双解耦框架分离外观与运动特征,结合多粒度跨模态对齐,在事件-图像融合中实现小目标移动分割SOTA。
打破交错思维中的模态隔离:通过逐步强化监督模态转换
提出模态隔离问题,用MoTiF框架通过转换级监督训练,提升交错推理中图文一致性及任务准确率。
语言引导的视觉推理抽象
提出L-VARC框架,用语言引导特权信息分支,通过语义压缩与跨注意力投影提升视觉推理,18M参数性能领先。
感知、交互、推理:构建工具增强的视觉智能体以进行空间推理
PERIA工具增强视觉智能体,利用感知与交互工具提升空间推理,性能超同类模型7%-14.8%,媲美大模型。
基于贝叶斯条件先验的多标签测试时自适应
提出贝叶斯条件先验(BCP)估计,无需梯度测试时自适应,通过锚定条件贝叶斯更新引入标签依赖,显著提升多标签识别性能。
放大关键所在:面向视觉文本理解的注意力引导自适应渲染
VLM视觉文本理解存在“定位而不利用”问题,AGAR利用注意力放大关键文本区域,显著提升多项基准性能。
利用密度均衡映射学习任务感知采样与共享显著性
DECNN利用密度均衡映射动态调整卷积采样,聚焦任务相关区域,提升效率并生成显著性图。
MAMVI: 通过掩蔽多视角点云实现3D测试时自适应
提出MAMVI,用混合掩蔽策略和单步多视图自适应,在ShapeNet-C等数据集上达SOTA精度,推理速度提升4.9-8.9倍。
面向实时个性化工效姿态分析的机器学习框架
提出利用3D点云多角度实时分析工效姿态的框架,用户标注训练个性化分类器,克服固定视角局限。
TetherCache:利用门控召回和可信对齐稳定自回归长视频生成
TetherCache通过门控召回与可信对齐的缓存管理,显著降低自回归长视频生成的质量漂移。
用于自动驾驶场景预测的扩散Transformer世界动作模型
潜在扩散Transformer模型预测自动驾驶场景,解决失真指标误导,KID比回归优4.8倍,动作可控(ρ=0.81)。
基于骨架的人体动作识别中保持质量的不可感知对抗攻击
提出分布法对抗攻击,无噪声扰动保持运动质量,新指标评估自然性,攻击成功且质量优。
GeoCFNet:面向机器人辅助内镜黏膜下剥离术的几何感知置信场网络
提出GeoCFNet,融合Token-Differentiated Fusion与几何正则化,实现精准稳定的置信场估计,引导机器人辅助ESD手术。
一种结合跨主体伪标签与语义对齐的多模态微手势识别框架
提出跨模态伪标签与语义对齐多模态框架,解决微手势低信噪比和长尾分布,F1达68.13%。
SAM-Deep-EIoU:用于多目标跟踪的选择性掩码传播
针对困难帧选择性调用VOS模型修正追踪,无需训练,显著提升多目标跟踪性能。
高效、鲁棒且抗共谋的图像扩散模型指纹识别
提出抗合谋扩散模型指纹法,编码于个性化归一化模块,参数变换防御共谋,保真鲁棒,提取准确率>99.5%。
面向TUMTraf V2X的合作3D目标检测中的相机与激光雷达BEV融合
融合相机与激光雷达的BEV检测器在TUMTraf V2X合作3D检测中达0.85 mAP,发现测试帧与训练重叠,微调和后处理分别提升至0.89和0.99 mAP。
物体先于词语:儿童视角视频中语言接地性的物体优先归纳偏置
提出BabyMind,通过物体优先偏置和跟踪链接物体文件,以多实例对比学习提升稀疏监督下的语言接地准确率。
一种可扩展轻量级统一架构用于像素合并图像传感器的去马赛克
本文提出模块化统一架构,可轻量扩展地处理多种像素合传感器去马赛克,并引入无学习CFA识别模块实现即插即用。
基于深度感知蒸馏的森林视觉地点识别
深度感知蒸馏框架向DINOv2注入几何线索,提升森林地点识别鲁棒性,证明深度是关键互补模态。
全分布式多视角3D实时追踪
MV3DT全分布式框架通过点对点协调实现实时多视角3D追踪,性能媲美集中式,支持大规模零样本部署。
SeamEdit:一种黑盒VLM无关的大图像语义编辑流水线
SeamEdit通过五阶段后处理流水线,解决大图像语义编辑中的变形、对齐漂移和接缝伪影问题。
皮肤肿瘤皮肤镜图像的级联分类:可控灵敏度与外部临床验证
级联分类提升皮肤肿瘤皮肤镜图像性能,可控灵敏度弥补单阶段不足,但泛化差距需外部验证。