当错位成为监督:监督式合成CT生成中的结构化标签噪声
配准残差实为结构化标签噪声,误导监督合成CT;感知损失与解剖评估可缓解。
GeoRefer-Bench:从指代像素到可验证地理空间推理的基准
GeoRefer-Bench以可执行逻辑形式和精确查询成功(EQS)评估地理空间指代分割,揭示模型关系推理短板。
UNWIND:面向压力检测的任意长度面部视频——无需时间分窗
将完整面部视频的时间维折叠为通道维,无需分窗即可整体检测压力,准确率达70.02%。
导航世界模型的视觉表征与历史建模
比较五种冻结视觉表征,提出缓存线性与平衡GDN架构,减少历史冗余计算,实现高效长上下文多查询预测。
AdaPilot:面向跨生成器文本到图像质量优化的场景自适应策略学习
提出AdaPilot,用端到端强化学习获得场景自适应、跨生成器可迁移的文生图质量优化策略,可零样本迁移。
星载差分摄影测量:面向大梯度形变的无控制测量,兼具结构免疫性与可预测精度包络
将星载光学重复影像相关建模为无地面控制的差分估计,提供可预测精度包络并减少对稳定地形依赖,实验验证。
CoSWA-YOLOv12:尺度不变的疟原虫微小目标检测与分割
将Wasserstein分配按目标尺寸反比路由,配合小波残差与M2-NWD损失,提升疟原虫分割召回。
PROVE:面向医学视觉问答幻觉检测的证明引导、机制感知算子验证
PROVE按问题证据结构分三类验证机制,动态激活加权五种算子,输出校准风险分,AUROC达0.821。
CATCH:基于条件Haar扩散的反事实解剖组织修复
CATCH在Haar小波域以条件3D扩散修复脑MRI肿瘤区,加权混合掩膜在BraTS验证集最优。
基于显式条件一致性引导与长尾自适应流匹配的精确多模态人脸合成
显式条件一致性引导结合长尾自适应流匹配,提升多模态人脸合成语义对齐,稀有属性掩码准确率提高29.38%。
QINA:面向预训练视觉模型的量子启发式非线性适配器
提出量子启发非线性适配器QINA,用可学习三角提升与有界聚合增强冻结预训练视觉模型,优于通用适配器。
STRAND:面向视频大语言模型的以对象为中心的时空监测基准评测与改进
提出STRAND基准与忠实准确率诊断时空监测缺陷,并设计对象中心框架减少幻觉、提升时序推理一致性。
AgenticCADedit:一种面向多模态3D CAD编辑的有状态、工具介导智能体方法
以持久状态上的可验证小步操作替代整体重生成,支持检查、验证与撤销,提升编辑有效性并降低输出开销。
胰腺导管腺癌切除术后生存预测多模态数据集
发布302例胰腺导管腺癌切除患者多模态数据集,含全切片、临床分子及生存数据,基准C指数约0.65。
Albireo:面向边缘端视频目标检测的自适应高能效推理框架
提出检测器无关的自适应推理框架,按逐目标卡尔曼滤波不确定性决定是否跳帧,节能12%–18%且精度不降。
SpectralCTGaussians:基于3D高斯泼溅的光谱CT投影域重建与基材料分解
提出基于3D高斯泼溅的光谱CT投影域重建与基材料分解方法,利用可学习基材料分数和能量基函数联合优化,性能优于基线。
VG-TIE:一种基于可视图的具有可解释性的表格到图像编码方法
VG-TIE用可视图将表格特征编码为二维图像,像素对应特征、强度示偏差,具备可解释性与竞争力。
探究白细胞是否为非洲血涂片图像中疟原虫假阳性检测的来源
七项分析证实白细胞非疟原虫检测假阳性来源;假阳性源于染色碎片与制片伪影,多任务学习更优。
ReCalMatch:面向半监督细粒度识别的可靠性校准语义引导
以多角度语义原型校准伪标签可靠性,结合视觉—语义一致性抑制高置信错误,提升半监督细粒度识别。
SALI:基于电影语法知识的镜头感知后期交互,用于文本到视频检索中的跨镜头关系匹配
SALI用镜头感知后期交互,将查询的主宾语分别与各镜头嵌入匹配,并加电影语法惩罚,大幅提升多镜头关系查询的R@1。
TopoFuse:面向三维冷冻电子断层扫描分割的拓扑感知三平面融合
将拓扑建模为可微投影算子,用持续同调引导的稀疏编辑修正体素,Betti误差降54%、Dice升4.6点。
注意间隙:网格引导的断裂血管修复
提出网格引导后处理修复nnU-Net断裂血管,Dice几乎不变,ccDice与连通性大幅提升。
OREO:通过即时渲染-编辑优化实现3D生成中的保真度对齐
提出OREO,利用2D扩散先验,以强化编辑动态优化渲染视图作监督,提升3D生成保真度。
基于轻量级视觉Transformer的U-Net用于MRI脑肿瘤分割
提出轻量ViT-UNet分割MRI脑肿瘤,仅260万参数,Dice达0.8446,优于UNet。
S2Planner:面向端到端自动驾驶的多尺度语义规划器
多尺度语义轨迹规划器,融合三相机与自车运动,粗到细迭代优化路径点,NAVSIM达88.03 PDMS。
AV-GRPO:面向联合音视频生成的模态锚定解耦扩散强化学习
提出模态锚定在线扩散强化学习框架AV-GRPO,解耦多模态奖励,提升音视频生成质量、对齐与同步。
面向稀疏短轴电影MRI心肌重建的解剖对齐表面场学习
提出解剖对齐表面场学习框架,于共享UV域重建稀疏短轴电影MRI心肌,精度与功能保持优于现有方法。
有限目标分辨率监督下的高效连续DEM重建
SCOPE从低分辨率配对学习连续地形表示,跨尺度高效重建;未见尺度误差较双三次降约12%,算力仅增约2%。
检索即定位:桥接大语言模型与 LiDAR 几何实现空间定位
利用LLM语言先验与LiDAR几何,候选检索加局部细化直接预测坐标,构建空间QA数据集,坐标预测优于基线。
计算神经形态成像中从事件建模动态系统传递函数
分析事件成像中阶跃、线性、指数探针逆滤波,比较MTF及噪声失配,线性/指数探针更稳健。
SplatLabel:基于4D高斯泼溅的伪标签
SplatLabel基于4D高斯泼溅生成LiDAR分割与语义占用伪标签,无需3D框,超越现有方法。
ConPro:对比投影预训练,用于DSA序列中标签高效的血管分割
ConPro以对比投影为自监督目标,提升DSA少标签血管分割,结合半监督达75.4/81.3 Dice。
关注推理关键:通过选择性概率质量集中对齐跨模态注意力
提出sPMC框架,仅正则化视觉响应注意力头,强化隐式视觉接地,零样本平均提升3%,最高11.3%。
EndoFSA:基于秩约束参数适配的内窥镜小样本图像生成
EndoFSA冻结预训练生成器,仅低秩更新少量参数以适配WCE小样本异常生成,合成图分类媲美真实图像。
OceanXL:基于分块划分与自适应剪枝的大规模水下3D高斯泼溅
OceanXL以分块划分与自适应剪枝实现可扩展的大规模水下3D高斯泼溅重建,兼顾高效与紧凑表示。
并非所有混淆都一样:面向细粒度飞机检测的来源感知不确定性诊断
提出A²E²,将混淆按偶然/认知与类内/类间分解为四类可量化来源,用于细粒度飞机检测,并以针对性干预只减少可约混淆。
基于姿态基础模型的运动攀岩免训练岩点使用检测
免训练,用冻结姿态基础模型指尖趾关键点检测攀岩岩点使用,F1达90.2%,优于基线。
AdaTex4D:面向4D高斯泼溅的自适应纹理容量分配
AdaTex4D为4D高斯泼溅按可见性梯度与形变尺度自适应分配纹理容量,纹理存储减半且质量保持,固定显存下更优并降低峰值内存。
GHOST-Q:研究量化视觉语言模型中同分取舍下被忽视的视觉接地幻觉
量化视觉语言模型即使保持总分,仍会显著改变视觉接地成败,且省内存未必降延迟,需联合评估。
超越空间基准:从空间推理到导航
空间推理基准难直接提升导航;提出两阶段微调与空间先验蒸馏,8B模型低训耗超越多系统。
AERIAL:精度保持的低精度脑电解码器鲁棒性的对抗评估
BCI实验中,精度保持压缩不提升脑电解码器直接鲁棒性,但剪枝显著降低对抗迁移效率,三者相互独立。
Ego-Exo4D 人体网格数据集:面向自我—他人视角采集的4D人体运动重建
Ego-Exo4D仅有稀疏3D姿态,本文提出大规模4D人体运动重建数据集Ego-Exo4D-HM及配套重建流程。
基于免训练轨迹路由的视频扩散加速
TRACK通过校准比较大小模型的预测差异,将低差异步骤路由至小模型,无需训练即可加速视频扩散推理,最高提速2.7倍。
OmniFabric:面向三维服装重建的连贯UV空间纹理合成
OmniFabric在缝纫图案空间合成全局连贯纹理,用扩散Transformer在UV域精炼去伪影,生成可重光照的逼真3D服装。
WanPE:面向现代文本到视频生成的电影级提示增强
WanPE以397B参数、105万视频训练,实现电影级镜头规划,30秒视频人类偏好提升50.86分。
TrackEverything:通过去重三维场景表示实现长时程稠密跟踪
提出TrackEverything,将视频表示为持久三维场景轨迹并去重,实现超千帧全点稠密三维跟踪,性能领先。
多模态大语言模型中的对齐幻觉
逐层视觉-文本相似度并非内容级对齐;受控干预揭示标量指标可被权重诱导,提出主角度间隙诊断,需任务证据校准。
基于智能手机的自动化测速执法方法
设计并测试智能手机自动测速与车辆识别流程,辅助交通执法;识别准确率有限,并探讨法律、技术与实践问题。
BiCC:用于实例感知分割的双向连通分量损失
提出BiCC,联合标注与预测连通分量,按预测实例惩罚假阳性,平衡病灶精确率-召回率,提升分割F1。
冻结超球面特征能否指导伪掩码选择?
用冻结自监督超球特征评分排序候选伪掩码,八池中六池平均分割精度超基线1.7至9.3个百分点并助训练。