当两种示踪剂意见相左:临床PET/CT分割中的多模态融合研究
评估PSMA与FDG PET/CT多模态融合策略,发现单示踪剂基线更强,融合未能一致提升分割性能。
自动驾驶中的单阶段目标检测器
综述自动驾驶单阶段目标检测器演进,对比主流模型,分析速度精度权衡与挑战。
Mise-en-Scène:扩散Transformer中隐式布局涌现用于人机协同设计
两阶段框架:扩散Transformer隐式草拟布局,匹配放置还原原图,效果最接近真实。
胸部X射线基础模型适应策略的子群性能分析
研究三种适应策略对胸部X光基础模型子群公平性影响,注意力池化性能最佳但公平性无一致规律,需逐任务评估。
GS-VLA:基于高斯泼溅的即插即用视角规范化方法,用于冻结VLA策略
提出轻量即插即用框架,利用3D高斯新视图合成实现视角规范化,无需重训策略,显著恢复视角偏移下的性能损失。
USR-Drive:通过3D高斯与框的联合去噪实现统一驾驶场景表示
提出USR-Drive,联合去噪3D高斯与框,统一动态重建与3D检测,几何与实例互促,实现自动驾驶场景SOTA。
ReWEIGH:校准词元级序数视觉证据以缓解大型视觉语言模型中的幻觉
提出ReWEIGH免训练解码干预,聚合视觉秩证据并与参考校准,将幻觉对象提及减少21.3%,平均延迟仅增1.33%。
全局协方差池化中矩阵对数归一化的正交多项式近似
用多项式近似矩阵对数,免特征分解,稳定高效;在细粒度识别和ImageNet上优于谱方法和平方根。
泛化音频驱动的精准鼓手动作合成
提出扩散框架,双目标损失解耦身体与鼓槌精度,实现厘米级精准,并泛化到真实音频。
反事实对比分析
基于反事实对比分析,直接操作数据分布而非决策边界,用StyleGAN2特征保细节,生成质量优于现有方法。
通过预NMS预测分布偏移检测目标检测中的后门
提出DistScan,利用后门导致预NMS类别分布偏移来检测,无需权重访问等,平均检测准确率提升27.32个百分点。
潜在世界模型中的决策度量对齐:用于MPC规划的诊断与动作条件目标
提出斯皮尔曼诊断与DA-LeWM动作条件目标,解决潜在世界模型MPC欧氏成本排序偏差,提升成功率。
QuARC-GS:面向基于高斯溅射的紧凑动态场景流式传输的量化锚定残差编码
提出QuARC-GS:规范帧加压缩残差,量化感知变形与变化门控致密化,保质量速度,存储最高省11倍。
SPK:为实时目标检测中的可解释分布外检测引出结构化先验知识
提出SPK,显式挖掘检测器隐含的结构化先验,构成五维表示,实现可解释且SOTA的分布外检测。
H²EDL:用于层次分类的超证据深度学习
H²EDL提出树结构超意见,实现层次分类,标定误差较交叉熵基线减半。
图像引导的GPR数据路面缺陷识别与新型3D深度学习架构
提出RGB与3D GPR数据结合的低成本标注方法,及新型3D CNN架构,有效识别路面修补和裂缝缺陷。
TractoGraphVLM:白质纤维束示踪的统一视觉-语言框架
提出统一视觉-语言框架,实现纤维束分类/检索/描述/问答,性能高且零样本迁移。
GuideFetch:辅助机器狗并发导航与物体取回的任务协调框架
GuideFetch用LLM规划验证并发取物导航,并行较串行减时41.3%,状态检查区分有效与完成。
眼底图像中的视盘分割:从经典图像处理与可变形模型到现代人工智能
回顾视盘分割从经典图像处理、可变形模型到现代人工智能的演变,总结方法特点,指出边界模糊与跨数据集泛化挑战。
SemanticSlider3D:免训练的三维对象连续语义编辑
提出无需训练的三维连续语义编辑方法,生成连贯变体,优于基线并支持原型决策。
自主农用拖拉机:面向精准水稻种植的集成杂草检测与激光雷达导航
提出集成杂草检测与激光雷达导航的自主拖拉机系统,卫星导航中断20秒仍保持定位,作物行检测置信度超过零点九。
超越布局与关节:面向具身交互的用法驱动代码场景
用法驱动生成代码场景,以任务为中心建模物体功能与交互,生成可执行可编辑仿真环境,用于具身AI与策略学习。
ORV:以4D占用为中心的机器人视频生成
提出ORV框架,以4D占用为中心,融合动作与占用先验,提升视频质量与可控性,构建数据集,支持多视角。
伯恩斯坦-瓦齐拉尼网络:基于干涉的量子机器学习
提出伯恩斯坦-瓦齐拉尼网络,借量子干涉进行监督学习,免梯度、通用逼近,分类与图像表示表现强。
LT-Mem:面向终身场景理解的波动感知时空记忆
提出LT-Mem波动感知记忆框架,融合3D感知与时序推理,三元记忆保留对象历史,性能超基线且更省。
LM-CartSeg:面向影像组学分析的膝内外侧软骨与软骨下骨自动分割
全自动分割膝内外侧软骨及软骨下骨几何分侧质控影像组学特征优于形态学骨关节炎分类曲线下面积零点九一
视觉语言模型在零样本隐私分类中的鲁棒性研究
系统评估开源VLM在零样本隐私分类中的表现,发现其抗扰动强但精度和速度不如专用小模型,仅靠规模不够。
基于频谱分形自相似性的可泛化AI生成图像检测
提出Fractal-CNN,利用频谱分形自相似性检测AI生成图像,跨生成器泛化强,准确率93.93%。
目光所及:基于凝视监督的多模态胸部X光诊断与报告生成
提出凝视监督多模态框架,利用眼动追踪提升胸片诊断与报告生成,AUC提升4.4%、F1提升13.3%,增强可解释性。
WorldPack: 面向长上下文视频世界模型的动态帧压缩
提出WorldPack,基于3D空间相关性动态压缩帧,扩展上下文至22帧,优于基线。
OccDirector: Language-Guided Behavior and Interaction Generation in 4D Occupancy Space
半监督医学图像分割去偏的语义类分布学习
提出SCDL框架,学习类别条件分布并对齐语义锚点,减轻类不平衡,提升半监督分割,尤其低频器官。
2Xplat:为前馈3D高斯泼溅解耦几何与外观建模
提出两专家设计2Xplat,分离姿态估计与高斯生成,无需位姿,5K迭代内媲美SOTA,挑战统一范式。
VTONQA:面向虚拟试穿的多维度质量评估数据集
构建首个VTONQA虚拟试穿质量评估数据集,含8132图像、24396评分、三维度,基准揭示局限。
IPV-Bench:面向多样化图像到视频生成场景的图像保护方法基准测试
首个图像保护基准,统一评估有效性、保真度与鲁棒性,发现保护与破坏冲突、跨模型迁移差、易被预处理攻破。
STAND:面向遥感图像变化描述的双粒度消歧语义锚定约束
提出语义锚定约束与双粒度消歧方法,逐步解决遥感图像变化描述中的视角、尺度及知识歧义,性能优越。
ForestMamba:几何引导查询的稀疏Mamba三维森林点云分割
提出森林曼巴方法,融合森林先验与线性状态空间模型,实现高效结构感知分割,性能优且推理快、显存低。
聚焦式推理:面向视觉语言模型的有状态、基于动作的视觉聚焦
提出Foveated Reasoner:从低分辨率视图按需聚焦,选择性获取高分辨率证据并注入解码轨迹,用强化学习优化,低视觉预算下提升准确率。
EgoMemReason:面向长时程第一视角视频理解的内存驱动推理基准
EgoMemReason基准评估实体、事件、行为三种记忆,含500个问题,最佳模型准确率仅39.6%,揭示长时程记忆远未解决。
REST3D:从单张图像重建物理稳定的3D场景
提出新框架,融合物理理解与约束优化,从单图重建物理稳定三维场景,降低物理误差,提升仿真稳定性。
先看清再回答:通过显著性驱动的感知重对齐缓解LVLM幻觉
提出无训练SDPR,以显著性注意力重分配、缓存对齐和对比解码缓解LVLM幻觉,效果优于SOTA。
面向街景新视角合成的有效多传感器条件化
融合稀疏激光雷达、环视图像与位姿,条件化视频扩散模型,实现高质量街景新视角合成,优于现有方法。
SpreadMark:基于扩频嵌入的鲁棒图像水印
SpreadMark:扩频嵌入全图,匹配滤波恢复,抗再生与稀疏化攻击,鲁棒且不可见。
迭代流匹配:路径校正与逐步细化以增强生成建模
提出迭代流匹配,校正路径、逐步细化,减少图像生成幻觉,可集成于多数生成模型。
基于笔触的交互式神经SDF雕刻
提出神经隐式表示上的交互式雕刻框架,支持笔触式实时修改,沿用户定义曲线平滑变形,保持隐式平滑性与交互性能。
PLASMA:布局感知基准揭示内存布局对GPU上图式ANNS至关重要
提出PLASMA框架,隔离图拓扑与内存布局影响;顶点重排序可提升QPS最高80%且保持精度。
事件因果RAG:复杂场景长视频推理的检索增强生成框架
事件因果RAG用视听哨兵切分事件、双图记忆检索,长视频推理准确率提升4.96%-11.67%,内存可控。
Mask2Real-WM:分割掩码作为可控灵巧世界模型的仿真到现实桥梁
提出分割掩码桥接的灵巧世界模型,解耦动态与渲染,仿真预训练加少量真实数据,实现23自由度动作可控预测。
CLARA:结合视觉语言模型推理的片段级多模态对齐仇恨视频检测
CLARA采用片段级多模态对齐,结合视觉语言模型推理与对比学习,精准捕捉仇恨视频信号,超越现有方法。