面向资源受限边缘设备的可靠推理神经符号路由
神经符号路由器用L*学习DFA,将查询分派给最便宜的精确求解器,树莓派上准确率高、延迟与能耗低。
小米-OCR-0 技术报告
小米-OCR-0:0.8B统一模型,兼顾文档解析与OCR理解,1.7亿语料加渐进训练,多项基准最佳。
来杯咖啡:以编译目标实现离散扩散的未来感知引导
COFFEE 分离序列依赖与目标,避免指数枚举,将全局偏好引导至未解析位置,支持硬约束与软目标,在多个基准实现强控制。
更多程序,还是更多次运行?区分 LLM 执行框架中的覆盖度与专精化
可控评估显示,重复运行会虚增覆盖;生成程序多显持续弱点,选择器无增益,覆盖与重复性不足以证明专精化
CoVLM-Bench:面向协同驾驶问答与规划的真实世界基准
提出车路协同问答与规划真实世界基准CoVLM-Bench,含2196帧、35136条标注,并构建统一VLM基线,显示问答适配与理由监督降低规划误差。
HEIR:学习具有功能角色的人-实体交互
HEIR基准用完整角色集合评测人-实体交互,CoRISP方法在重复角色与共享参与者事件上领先。
HERO:面向肿瘤学的鲁棒表示组织学编码器
HERO病理基础模型基于5亿切片训练,对中心、扫描仪和染色差异鲁棒性最强,临床任务表现领先。
基于即时成本CVaR并具性能保证的风险规避在线POMDP规划
对每步信念即时成本应用CVaR,保留期望目标,现有POMDP规划器仅改成本即风险规避并具性能保证。
超越对称智能体:小语言模型中的认知多样性与多智能体辩论
认知多样性假设被否;辩论优势实为集成采样效应,匹配预算下不及自洽性采样,收益源自首次答案交换。
OpenAI-HuggingFace:复现与对齐测试的启示
复现错位事件,审计智能体可诱导类似行为,算力是关键,上下文RL可降低算力需求,呼吁可扩展自动对齐测试
经验时代中的自发现强化学习:学习历史是资产还是负担?
首次因果审计自发现RL规则,学习历史既扩展奖励尺度又因错配成负担,重放保留影响适应优势。
表征简洁性与电路规模呈阈值依赖式解离:基于对抗训练的受控检验
对抗训练受控测试表明,表征简洁性与因果电路规模解离,高忠实度下鲁棒模型电路边数显著更少。
有效的大语言模型微调是否需要人类可读文本?
DASA以激活梯度反馈优化合成嵌入,无需人类可读文本;微调媲美源文本,较GRADMM提速近5倍。
系统化多智能体视觉语言导航:形式化、基准与方法
首次形式化多智能体视觉语言导航为约束协调问题,提出MAVLN基准与TRISS系统。
CoDimRecon:面向仿真就绪三维场景的智能体重建,涵盖可变形曲线、曲面与体
提出智能体框架CoDimRecon,从多视角RGB重建含刚体、铰接与可变形曲线/曲面/体的仿真就绪场景,并经行为测试修正。
词元边界的代价:压缩证书与预测
边界增加最优词元数28.3–36.8%;压缩与预测偏好不同词典,许可少量边界可恢复多数收益。
AerialDojo-200K:面向开放世界空中目标搜索的大规模基准套件
提出大规模基准AerialDojo-200K,含42个仿真场景与20.5万任务实例,推动开放世界空中目标搜索研究。
持久性强制:利用像素空间扩散中的特征特化
像素空间DiT异质细化形成持久/活跃特征,PerF借此引导生成,ImageNet上取得更低FID。
E-CONAN(蕴含、矛盾与中立)诊断数据集:探究阿拉伯语自然语言理解中的语言现象
提出阿拉伯语NLU错误分析层级及E-CONAN诊断数据集,评测14个模型,发现大模型常识强、句法弱。
同一几何,不同结果:视觉语言模型中模态差距的读出依赖效应
统一几何解释模态差距:均值分离近似秩一;差距修改因任务而异,可改善、损害或恢复分类与检索性能。
学会从上下文学习:基于扰动公共文档的合成训练
用扰动公共文档合成训练数据,免人工标注,显著提升大模型从上下文学习能力。
超越流形假设:面向流匹配的混合谱参数化
提出混合谱参数化,自适应时间与数据协方差方向,跨架构稳健、加速优化且几乎不增训练成本。
考问翻译:一种基于证明器的自然语言→一阶逻辑评估指标
提出SIV,用定理证明器生成正反探针评估NL→FOL翻译,检测漏译与多译,评分贴合错误严重度并定位错误。
ManiEdit:从流形视角出发的语言模型序列化非结构化知识编辑
从流形视角重构编辑,提出ManiEdit,通过枢轴定位与流形感知保持,显著提升序列化非结构化编辑效果。
PolyStepOR:无需最优决策即可学习决策
PolyStepOR 无需最优参考决策与梯度,借扰动评估和最优传输直接优化实际决策成本,支持约束预测并具理论保证。
TimeES:基于演化谱的概率性与确定性时间序列预测
TimeES借演化谱理论,将非平稳序列建模为随机变量调制的演化谱表示,高效实现概率与确定性预测领先。
利用机器学习探究空腹血糖的预测因素:昼夜节律时机与年龄交互作用的洞见
基于NHANES数据,可解释机器学习预测空腹血糖,糖化血红蛋白主导,昼夜节律与年龄交互作用弱但值得研究。
面向高效医学图像增强与分割的硬件感知函数式Kolmogorov-Arnold网络
提出硬件感知两阶段压缩FunKANLite,参数量降至1/5.6、能耗降68%、吞吐增2.9倍,保持医学图像增强与分割精度。
HoTS:用于图神经网络校准的同配性感知温度缩放
提出同配性感知温度缩放HoTS,用局部同配性和logit熵为节点分配温度,提升GNN节点分类校准。
Tsubame:基于扩散的推测解码中的树重放
Tsubame采用两遍树推测解码:先冻结上下文感知拓扑,再重放采样节点,结合扩散草稿,无损提升接受长度与吞吐。
并行扫描下的长度无关状态跟踪
提出NFSM:非仿射可并行扫描RNN,有限精度下实现长度无关状态跟踪,突破仿射模型限制。
面向参数恢复的神经似然符号蒸馏
面向参数恢复,将神经似然蒸馏为可解释符号表达式,扩散决策模型上加速超百倍且保精度,可用于贝叶斯层次推断。
Jev 在语音神经假体重评分中媲美 7B 语言模型
Jev将重评分转为单次类型化决策,无需GPU,在ALS语音神经假体上词错率7.5%,媲美7B模型。
安全重构:通过掩码扩散生成式建模构建强大安全护栏
LLaDA-Guard用掩码扩散按标签重建文本,安全基准领先、校准更优,可定位并改写不安全提示。
重置不等于恢复:通过谄媚迟滞评估虚假对话上下文中的可恢复性
受用户错误压力后,普通重置难以消除谄媚偏差;仅删除/截断压力历史或引入可信证据可有效恢复。
重新思考大语言模型强化学习中的训练-推理不匹配:根源与纠正
针对大语言模型RLVR训练-推理概率不匹配,提出校准重要性采样CIS,以置信感知截断校正,实验更优。
回写Δ:以全新表示重访同一词元
ReFlux回写层间深度增量Δ重访同一词元,动态组合反馈路径,降低困惑度并提升推理准确率。
一个模型不成众:多LLM与方面条件化的多样化评论生成
多模型与方面条件生成能更贴近人类评论多样性分布,在预训练与下游任务中均有效,但人类多样性仍难企及。
弥合跨方言鸿沟:以查询计划作为Text-to-SQL的可移植接口
让模型生成方言无关的关系代数查询计划而非SQL,可近乎一致地恢复跨方言可移植性,微调后效果优于SQL监督。
将非平稳多输出高斯过程适配于贝叶斯优化
提出MOLRN-BO,将非平稳多输出高斯过程适配于多目标贝叶斯优化,在12个基准上提升性能与稳健性。
SAGE:面向自演化智能体的统计接受门控
提出统计接受门控SAGE:用逐项配对比较与单侧配对检验筛选技能编辑,显著降低回退并提升最终得分。
PowerZooJax:面向强化学习的基于JAX的电力系统基准
提出基于JAX的电力系统强化学习基准,涵盖五类约束MDP任务,全流程GPU加速,支持安全与分布外评估。
探讨从图像数据中识别拓扑关系的学习模型
构建1.1万张标注图像数据集,对比传统与深度学习模型,VGG16准确率达89.55%,凸显迁移学习优势。
跨编排架构的小型LLM团队扩展的精确生成–变换分解
小型LLM团队扩展收益任务依赖;生成–变换分解揭示覆盖与转换红利,无架构通吃。
通过免训练自适应响应几何提升度量深度补全
提出免训练自适应响应几何,将深度/对数深度/视差坐标变为图像级未知,提升度量深度补全精度。
GeoWind2Plan:面向节能无人机规划的任务时三维城市风场预测
提出几何—风场—规划框架,用神经算子约3秒预测城市三维风场,CFD评估下较无风感知规划节能4.5%–12.7%。
FD-AA:一种用于胸部CT中偶发腹部异常检测的轻量级焦点-弥散与衰减感知分类头
FD-AA轻量器官感知头结合衰减感知与掩码广义均值池化,在冻结3D CT编码器上提升偶发腹部异常检测性能。
PreviewDiff:多模态评判器引导的扩散隐空间搜索
无需训练,在去噪中途解码预览,由多模态评判器反馈分支搜索并重噪隐变量,让验证算力在生成过程中主动引导。
话虽对,时不对:基于临床医生评审对年轻人与ChatGPT的19,930次对话中心理困扰的分析
分析近2万次年轻人与ChatGPT对话及临床医生评审,发现其痛苦时回应易过度,并提出三阶段设计指南。
LeRF:面向视角采择推理学习参考坐标系
训练视觉语言模型构建显式参考坐标系,先监督微调再强化学习,提升视角采择推理。