CMambaDepth:基于通道Mamba与混合注意力的自监督单目深度估计
提出CMambaDepth自监督框架,以双向/单向通道Mamba实现多尺度融合,混合注意力兼顾局部与全局建模。
STA-TFM:面向姿态估计的跨视图时空聚合变换器
STA-TFM融合单目DSTformer与跨视图Transformer,实现多视图3D姿态估计,大幅降低关节误差。
空间动作审查:用于审计电子显微镜中语言到动作交接的可视分析仪表板
针对MLLM中答案正确却空间动作漏检的"静默失败",提出可视分析仪表板,联动记录与图像证据支持审计决策。
基于视觉Transformer的相机空间精确手部姿态估计
针对相机空间手部估计的深度歧义与位姿耦合难题,提出变换同构监督、透视信息嵌入及帧率感知训练。
MECAIL:基于14.6 KB时空专家的通信感知目标检测增量学习
MECAIL实现通信感知增量目标检测,以14.6 KB时空专家适配基础模型,低带宽部署,性能媲美大参数量方法。
激光雷达语言模型真的理解时空关系吗?
提出LiDAR-Hallu基准,揭示4D激光雷达语言模型时空推理失败,常混淆相反关系,聚合准确率具误导性。
MIGA:面向加速三维多回波MRI的共享几何高斯表示与隐式幅度建模
MIGA融合共享高斯几何与隐式幅度建模,仅用欠采样k空间重建,加速三维多回波MRI且性能更优。
长镜头帆板视频的身份一致性分析:一种领域专用的离线跟踪系统
提出离线帆板跟踪系统,检测并保守关联轨迹,以帆色和姿态驱动骑手相对虚拟相机,F1达0.937,优于OC-SORT与BoT-SORT。
AgentSTAR:基于智能体的单目视频形状跟踪与重建
提出智能体式分析合成,VLM渲染对比迭代优化,从单目视频重建跟踪3D形状,抗大运动遮挡,超越SOTA。
VPRune:高效免训练的LLM前视觉Token剪枝
免训练LLM前视觉Token剪枝框架,结合多样性选择、相似回收与位置保持,兼顾精度与压缩并降低边缘延迟。
神经细胞自动机的应用:现状、挑战与机遇
综述神经细胞自动机的基础、架构改进及其在医学影像分析、分割、分类、配准、深度估计与图像合成中的应用,并分析其优势、研究空白与未来机遇。
0.5%>100%:面向指代图像分割的双向互惠学习
提出BRL适配器框架,实现冻结基础模型中双向跨模态交互,以不到0.5%参数更新达指代图像分割最优性能。
面向多模态目标重识别的激励噪声与结构先验注入
提出正激励噪声与结构化提示调制框架,破解文本噪声与跨模态结构差异难题。
ME-VLM:面向具身认知与智能体协同的统一视觉语言模型
提出统一视觉语言模型ME-VLM,融合具身认知与多模态智能体能力,兼顾多任务表现与端侧部署。
整合多模态超声与临床数据对肝细胞癌微血管侵犯的术前预测:一项多中心研究
多中心研究显示,整合多模态超声与临床数据可术前预测肝细胞癌微血管侵犯,外部验证AUC约0.90。
动态热高斯:多模态4D高斯泼溅
提出首个动态RGB-热多模态4D重建框架,联合建模外观、温度与几何的时序变化,实现高保真时空重建。
评估pCLE拼图配准的变换模型
建132对pCLE标注帧数据集,用TRE评估变换模型与六种匹配器:TPS最优,配对质量难预测拼图质量。
MIRAGE:面向智能眼镜的全身旁观者隐私保护与基于同意的恢复机制
MIRAGE三层架构守护智能眼镜旁观者全身隐私,支持合成替换与同意式加密恢复,掩码令轮廓重识别近乎随机。
真实图纸上什么得以保留:建筑文档视觉中的主动采样、连接组布线及匹配基线
冻结果蝇连接组模型在真实图纸上更鲁棒,小模型胜大网络;精确布线关键,但增益主要来自视网膜采样。
HyperCLIP++:在双曲空间微调CLIP实现开放词汇语义分割
HyperCLIP++双曲空间缩放嵌入半径对齐层级,DCRC同步双模态,仅调5%参数,三基准SOTA。
FedMust:面向多器官CT分割的半监督多任务学生-教师联邦学习
提出半监督联邦多任务师生框架,利用标注与未标注数据提升多器官CT分割,平均性能增益13%。
基于动态与不确定性感知的树状高斯过程分类器的视频手术技能评估
融合表示流CNN与动态不确定性感知树状高斯过程分类器,设计语义感知复合核,手术技能评估准确率达96.9%。
高分辨率二氧化氮地图揭示欧洲暴露限值超标情况
机器学习绘制欧洲逐小时10米级NO2地图,发现91个监测达标区日均限值超标,约2000万人受影响。
Ev-YOLO:通过统一证据建模实现不确定性感知的目标检测
Ev-YOLO将分类与框回归统一为证据框架,输出可解释不确定性;精度相当且定位不确定性可识别错误检测。
MiTHras:面向核分裂象分析的任务特定分层半监督对比掩码自编码器
提出MiTHras,结合伪标签引导图像/令牌级对比学习与掩码重建,在核分裂象分析中表现领先,表征稳健可迁移。
什么造就了优秀的医学图像分词器?重新思考医学图像分词中的重建与生成
系统评测医学图像分词器,发现重建与生成强相关、隐空间利用率低、记忆轻且随压缩减弱、离散量化多保分类(查表法除外)。
ReSTI:基于源数据的 STI-Bench 审计与修复
审计STI-Bench发现坐标系、时间戳等错误,ReSTI基于源数据修复,保留1782题、排除282题。
GraphSVR:面向扩散MRI的q空间感知图神经网络切片到体积配准
GraphSVR:q空间感知图神经网络,实现扩散MRI四维切片到体积配准,严重运动下误差降73%。
基于关系锚定的自动驾驶潜世界模型
以交通场景图为语义监督对齐潜表征,推理时免图、免3D标注,轨迹误差降5.9%,碰撞率降52.4%。
超越统一子空间:面向多任务模型融合的谱感知与深度自适应融合
提出SADA-Merging:按谱复杂度分配子空间容量,依可塑性保留谱信息,深度锚定补偿投影失真,实现免数据多任务融合。
PrismGPT:基于代理引导学习与自合成推理的区域感知照片编辑
提出PrismGPT框架,用代理引导学习与自合成推理生成区域感知编辑方案,仅约6%训练数据即达最优。
当更宽视角失效:前馈三维重建的压力测试
固定输入预算、扩大视角跨度会使前馈三维重建模型性能骤降,出现表面覆盖不全与几何失真,暴露分布偏移失效模式。
迈向森林点云的基础模型
自监督预训练多平台森林点云,标注稀缺时提升四类任务性能与迁移性,实例判别是通用基础模型的主要障碍。
Ananke:收缩环面吸引子网络
提出Ananke/CTAN,以乘积环面双相流学表示,0.27M参数在Kvasir-v2达90.52%。
面向医学诊断的移动成像解决方案:趋势与应用
综述移动设备图像医学诊断研究,比较各类方案优劣,指出低成本可及医疗的潜力与挑战。
INTCORT:通过输入变换与置信度路由实现视觉语言模型免训练空间推理增强
免训练框架经输入变换构建多视图,以关系标记置信度路由聚合预测,空间推理平均提升10.01%。
易于适配的流式视频编辑
提出SVEET,在预训练双向视频扩散模型上训练,解耦实现实时流式视频编辑,单H100达15FPS。
BraTS 2026 任务 1 脑转移瘤分割:多架构比较
多架构对比脑转移瘤分割:Primus总体最优,ResEncL病灶级F1更佳,并揭示三个后处理陷阱。
ZVeC:面向实例级车辆提取与生成式点云补全的零样本框架
零样本实例级框架将场景补全分解为车辆实例重建,用扩散模型补全并重组,地下稀疏输入下几何一致。
虚拟神经网络:一身百魂
虚拟神经网络固定参数量、靠算力扩展,由少量物理模型生成数百共享权重虚拟模型,鲁棒性与精度随数量提升。
VideoGen-Agent:强化视频生成智能体
VideoGen-Agent通过多任务强化学习调用外部工具生成视频,在自建VABench基准上得分由56.5升至86.1。
PixelDiT2:基于表征锚定的像素扩散Transformer
提出PixelDiT2,以冻结视觉基础模型的逐块表征引导,解耦表征学习与像素生成,免自编码器,FID达1.46。
解剖分解的胸部CT投影作为胸片骨抑制的可扩展监督
提出CT解剖分解投影框架,生成像素配准配对监督,无需真实配对数据即可抑制胸片骨骼,提升骨重叠区异常检测。
DTKDP:面向轻量级有向SAR舰船检测的双教师知识蒸馏与剪枝框架
提出双教师蒸馏剪枝框架DTKDP,大幅压缩有向SAR舰船检测模型,参数算力大降且精度近原模型。
GAE:学习几何原生潜在空间以实现3D一致的世界生成
提出几何原生潜在空间GAE,作为感知与生成共享基础,显著提升3D一致生成质量与连贯性。
重新审视多视图立体:一种序列到序列的表述
将多视图立体转为序列到序列任务,以相机感知模型和全局代价体联合预测全部视图几何,性能达最优。
SPHQuant:面向视觉语言模型的高效极低比特权重量化
SPHQuant以无旋转球面量化分解权重,将离群值隔离至半径并加精度,兼顾极低比特精度与吞吐。
WorldCrafter:具有隐式3D感知记忆的一致视频世界模型
提出以相机可查询的隐式3D记忆压缩多视角历史的视频世界模型,实现长时程一致、相机可控的流式探索。
SLICEChat:面向全切片病理语言模型的编码器内渐进式Token剪枝
SLICEChat在全切片病理MLLM编码器内渐进剪枝Token,融合Mamba与Transformer,兼顾精度与效率。
通过专业化基础图像模型生成胸部X光反事实图像
提出专业化框架,将预训练生成模型转为因果机制,构建胸部X光反事实模型RadCF,高效且能缓解分类器捷径学习。