UoU:基于大规模无监督学习的通用指纹基础模型
UoU通用指纹基础模型,采用多级表示与混合训练,利用领域结构,支持多种下游任务。
基于接触式条纹投影轮廓术的高分辨率三维表面测量方法,用于反射和透明物体
提出接触式数字条纹投影三维测量方法,通过三角测量实现高精度稠密表面重建,提升反射和透明物体测量精度。
WeaveLA:事件驱动的跨子任务潜在记忆编织实现重复机器人操作
WeaveLA通过事件驱动跨子任务记忆编织,在重复操作中实现零到47.8%成功率提升,不影响单次执行。
基于强化学习优化器的分布外检测的理论基础
提出RL引导优化器,在梯度下降上添加校正项以降低语义OOD误报率,并建立理论框架分析泛化误差。
通用图像恢复:通过内化思维链推理
提出CoTIR框架,将思维链推理内化于单一模型,利用预训练编辑模型和拉格朗日优化,实现混合退化下的高质量恢复。
SPHINX:先解释,再探索
通过可解释AI分析驾驶策略弱点,再生成针对性对抗场景,提升自动驾驶决策鲁棒性。
GeneralVLA-2:用于机器人规划的几何感知重建与受控记忆
提出GeoFuse-MV3D和受控记忆系统,提升机器人规划性能,基准测试指标显著改进。
Reinforcing Dual-Path Reasoning in Spatial Vision Language Models
StereoFactory:一个用于鲁棒立体匹配的统一合并框架
粗到细进化框架融合模型,遗传算法选子集、CMA-ES优化路由,降低误差,时间仅为联合重训练的2.7%-3.7%。
TaFD:威胁感知频率解耦的异构攻击鲁棒性方法
TaFD通过频域分治解耦异构攻击梯度冲突,实现威胁感知鲁棒防御,平均鲁棒准确率提升约11%。
OmniDrive: 大语言模型编排的多智能体世界模型——通过统一潜在协同压缩生成多视角驾驶视频
提出DRIVE-CHOREO,利用多智能体协作与统一潜在协同压缩生成多视角驾驶视频,在nuScenes上取得新SOTA。
RT-Counter:实时文本引导的开集目标计数
提出VPT模块和Weaformer层,实现实时高精度开集计数,速度112.48FPS,MAE13.30。
面向文档布局分析数据集重标注的边界框标签传播
提出BBLP框架,用10%标注数据通过多模态嵌入传播标签,实现文档布局分析高质量重标注,节省人力。
多视角卫星影像中基础模型特征的几何一致性协议
提出适用于RPC框架的几何一致性协议,集成3D度量与几何约束匹配,揭示高相似度不保证可匹配性。
TivTok:面向可扩展视频分词的时间不变令牌广播
TivTok通过时间不变与可变令牌分解,实现视频高效压缩,令牌数仅需下采样方法的1.1%。
基于轨迹直线性的修正流根选择不动点逆推
SelFix通过选择更直轨迹的不动点解,提升修正流逆推的重建与编辑质量。
Flux-Guard:基于扩散模型的面部身份保护
Flux-Guard框架集成面部编辑与隐私保护,通过流轨迹控制和自适应对抗优化,提升跨域攻击成功率并保持视觉质量。
SkillMoV: 基于原型条件门控的视图混合路由用于统一多视图熟练度估计
SkillMoV提出混合视图投影器,在六个技能域统一评估,Exos准确率50.17%超最强3.57%,仅训练23.32%参数。
面向鲁棒文本引导开放词汇目标计数的测试时训练
提出退化条件下TOOC基准Robust-TOOC与双架构测试时训练框架Dual-TTT,仅更新轻量去噪模块,无需标注,提升鲁棒性。
RAVA:检索增强的视角对齐用于主题驱动图像生成
RAVA通过检索增强提供几何证据,实现跨主题视角对齐,显著优于现有方法。
分割、审议、决策:面向细粒度自我中心动作识别的多智能体框架
采用VLM编排提案、异质专家审议与Borda聚合,零样本提升细粒度动作识别性能。
MambaCount: 基于空间稀疏状态空间对偶块的高效文本引导开放词汇目标计数
MambaCount通过S⁴D块解决Mamba因果制约与高熵问题,文本引导计数线性复杂度下达最优性能。
胸部X光片的视觉-语言模型并不总是需要图像
视觉-语言模型用于胸部X光时可能忽略图像,文本模型与多模态性能相近,临床部署应依赖接地审计而非准确率。
BrainWorld:一种基于结构先验条件的全脑4D fMRI动力学生成模型
BrainWorld利用sMRI结构先验生成全脑4D fMRI,可稳定生成长序列,提升下游任务并学习可迁移多模态表征。
我们真的需要扩散模型吗?一种用于配对医学图像翻译的快速U-Net
轻量级U-Net在MRI脂肪分数估计中超越扩散模型,速度快208倍,误差更低。
先审视,后作答:基于充分性驱动强化学习的视觉证据预对齐
提出VEPA方法,在预训练与后训练间加入充分性驱动强化学习,优化视觉证据描述,增强多模态大模型视觉对齐与推理性能。
基于Voronoi图的结构化对抗伪装
Voronoi图优化种子点生成结构化迷彩,可降低行人检测AP,跨域鲁棒。
云污染下近实时土地利用/覆盖测绘的异质SAR-光学融合:新框架与全球基准数据集
提出CloudLULC-Net融合框架与全球基准数据集,从云污染图像与SAR数据直接预测土地覆盖,精度达86.60%。
GSPan: 一种用于任意尺度全色锐化的连续高斯基元表示
GSPan用连续2D高斯基元表示残差细节,实现任意尺度全色锐化,无需重训且加速推理,融合性能达SOTA。
SegTME-UNI2:基于基础模型的可泛化多类细胞分割与LLM驱动的肿瘤微环境表征框架
提出SEGTME-UNI2框架,实现多类细胞分割与LLM驱动的TME表征,通过三级伪标签课程提升泛化性,验证可行。
ActWorld:通过动作感知记忆从可探索到交互的世界模型
ActWorld通过动作感知记忆和交互数据集,实现导航与物体交互统一的交互式世界模型。
LiveStarPro:面向长时流媒体的层级记忆主动流视频理解
提出LiveStarPro,通过三级组件实现长时流媒体主动理解,语义正确性提升28.9%,时序误差降低18.2%,推理加速1.58倍。
MLLMs Get It Right, Then Get It Wrong: Tracing and Correcting Late-Layer Textual Bias
MaineCoon:追求实时音视频社交世界模型
提出首个22B参数实时音视频自回归模型,单GPU达47.5 FPS,专为社交交互优化,实现亚秒级长时生成。
阿尔茨海默病多模态生物标志物的定量分析
定量分析789名AD患者多模态数据,揭示tau、结构MRI、认知间的跨模态关系与主导退行轨迹。
基于人在回路和图集的交互式内容工作流中3D资产分割
提出人在回路管道,通过交互分割和UV反投影生成3D资产分割图集,但细结构等仍需手动修正。
百万级多模态花粉显微镜图像分析:专家引导的基础模型
提出百万级多模态花粉数据集,结合专家引导基础模型实现高精度自动识别与形态描述,为花粉监测提供基准。
MoonSplat:基于Sim(3)全局优化的单目在线高斯泼溅
提出融合Sim(3)全局优化的在线体素化3DGS,实现鲁棒相机跟踪与闭环,颜色残差学习加速收敛并达SOTA,已部署无人机主动重建系统。
从MRI进行盆腔器官的高保真三维几何重建:一种混合深度学习和迭代优化方法
提出混合深度学习与迭代优化框架,高保真重建盆腔器官,几何精度优于现有方法,网格质量更高。
基于顺序无关单元格级表示,重新审视自回归多任务表格识别中的结构依赖
提出结构精炼模块,产生顺序无关单元格特征,实现并行推理,性能提升且推理时间减至三分之一。
即插即适应:基于预训练对齐模型的即时多模态指代消解
提出无需训练的即插即适应方法,利用预训练对齐模型和证据理论融合视觉语义,在多模态指代消解任务中性能提升5.31%以上。
超越视觉线索:基于思维链增强推理的半监督医学图像分割
CERS框架集成思维链推理与语义参考选择,解决视觉-语义不匹配,显著提升半监督分割精度。
HLS-GPT:面向大陆尺度NASA协调Landsat与Sentinel-2全波段任意日期反射率重建的生成式预训练Transformer
HLS-GPT实现全波段任意日期反射率重建,CONUS训练测试,RMSE低于0.026。
高斯光场溅射:物理先验驱动的视觉Transformer用于无监督低光图像增强
提出高斯光场溅射视觉Transformer,以物理先验驱动自注意力,结合颜色与亮度损失,实现无监督低光增强SOTA。
Robustness of Similarity-based Positional Encoding Under Rotations: Theoretical Analysis and Experimental Validation
Reload-Mamba:面向多类语义分割的分层抗稀释状态空间建模
提出Reload-Mamba框架,通过边界监督、类不确定门控与分层重载机制解决状态空间传播中的响应稀释,在ADE20K等数据集上取得领先性能。
SegDINO:将多尺度结构引入DINO以实现高效医学图像分割
SegDINO通过轻量尺度建模实现高效医学图像分割,在多个数据集上取得最佳性能。
AIGS-Net:基于2D高斯泼溅的紧凑光照场建模实现快速低光图像增强
提出AIGS-Net,仅40参数,通过自适应2D高斯泼溅光照场实现快速低光增强,提升细节与色彩。
PhaseWin:一种用于忠实视觉归因的高效搜索算法
PhaseWin提出分阶段窗口搜索,将忠实视觉归因的评估复杂度从O(n²)降至O(n),保持近贪心忠实性。
先恢复语义,再生成更好:面向3D MRI重建与跨对比度合成的改进潜空间建模
提出语义优先潜空间框架,通过全局依赖编码、语义恢复与频率损失,提升3D MRI重建与合成质量。