HarnessRisk:面向智能体框架生命周期的安全基准
提出HarnessRisk基准,覆盖框架配置等六阶段,发现配置阶段最易受攻击,显式风险识别未必带来安全行动。
从学生风险预测到SC2R:面向教育决策支持的语义约束反事实补救
SC2R框架结合预测模型、整数规划与SHACL验证,生成可行且语义合规的干预计划,提升教育决策可操作性。
tinyDSM:面向资源受限微型机器人的技能建模与发展框架
提出技能建模框架,用内在动机与适应度评估,使资源受限微型机器人用极少先验知识自主从基础动作学到复杂轨迹
立场:神经约束推理的可验证正确性需符号集成
硬约束存在且验证成本低时,神经约束推理须优先符号集成而非纯学习;双向集成可实现高效与可证明正确。
未写下的基准:多模态机器学习在抽象感知推理中的新挑战
新基准测试发现多模态模型抽象推理远逊人类:由笔声和手部动作推断单词准确率不足一成,融合反而降效。
立场:AI锁定正在进行,我们必须做好准备
AI安全研究忽视过度依赖风险,AI锁定导致人类技能退化与系统脆弱性,需在各层面提前防范以保自主与安全。
从Doyle到AGM:信念变更调查与实现路线图
综述信念变更从Doyle/London到AGM的演化,梳理理论根基,为计算实现提供路线图。
Position: Want Better ML Reviews? Stop Asking Nicely and Start Incentivizing with a Credit System
Euclid-Omni:平面几何的统一神经符号框架
提出统一神经符号框架,融合形式几何系统与大模型,自动生成训练数据,奥赛级计算与证明性能优异且算力需求低。
LLM智能体是否理性谈判?基于A2A/MCP的可验证多智能体交互机制设计框架
提出可验证多智能体谈判框架,编码经典机制并运行时验证;实验显示结构化协议成功率高,但激励兼容性不自动转移至LLM行为。
大型语言模型及其对力学与空间几何的感知
MecEng基准评测LLM的力学与空间几何能力:刚体任务开源模型86.0%、专有91.4%,柔性更难。
任务级和会话级模型路由:四款开源路由器跨四个基准的通用接口混合评估
评估四款路由器,仅语义路由器随提示变化,但无任务优势;收益源于层级配置。
审计AI生成的数学证明:量子并行重复中贪婪条件引理的修正
AI生成证明存在极性错误,引理本身正确但续接条件用反,给出反例并补正,不验证主定理。
重排序器所见:面向长文档多模态问答的多方面页面标注
提出Trident,通过页面语义标注与自适应重排序提升长文档检索F1,并借生成侧透镜增强开放问答准确率,显著优于基线。
个性化自动研究:迈向真正的AI合作科学家
提出个性化自动研究框架,用图构建研究者画像,贯穿检索、实验、写作等全流程,避免不同研究者得到相同结果。
MINT:最小选择偏好蒸馏实现均衡多目标对齐
用最弱目标而非加权和排序候选,蒸馏最佳平衡样本,显著提升多目标均衡性,超越人类专家。
通过建议渠道造成的个体赋权丧失:影响力内生时的控制权损失
仅能建议的AI可通过信息培养依赖,削弱人类控制权;长期部署比短期更危险,影响上限失效。
利用离线强化学习发现高质量国际象棋谜题
利用离线强化学习分析15亿解题数据,发掘高质量棋题,显著提升停滞期初学者棋力。
生成上下文与受管状态:可问责纵向临床推理的功能条件
纵向推理是部分可观测状态估计;问责需证据账本、信念态、观测模型、因果类型。六层框架:LLM高能力低成熟。
技能块:智能体应如何加载技能?缓存校正下预加载、按需工具加载、渐进式披露与混合方式的比较
比较四种技能加载法,混合法减输入27-40%,多轮大技能最高降73%,质量无差异。
工具结果是否比纯文本更具权威性?——使用 Claude Opus 5 的合成赋值任务中虚假声明采纳的三项前瞻性研究
测试Claude Opus 5对工具结果与纯文本的信任度:工具结果可致虚假采纳,但复制不稳定,且不高于纯文本。
前沿AI预测存在测量问题:对进展证据的审计
前沿AI预测有测量问题:算力与METR观测缺失,基准衔接不稳,证据集中单一来源,需版本化测量体系。
小模型侦察大模型数据控制中的瓶颈顺序
小模型轨迹可揭示大模型技能瓶颈顺序;LogFloor按瓶颈分阶段训练,节省30%-56%token,顺序是关键。
基于韧性引导的特质条件化可穿戴生理信号在阿片类药物使用障碍中的渴求估计
提出RETRACE框架,利用韧性特征分离压力与渴求信号,无需个体重训即可提升交叉受试者渴求检测准确率7%。
面向按需城市空中交通网络设计的需求驱动垂直起降机场选址与离散事件车队仿真
需求驱动选址与仿真框架;洛杉矶案例高需求16站12机。大机队改善准点但不减空载,UAM更适合长距或拥堵出行。
TAHB:文本属性超图学习的综合基准
首个文本属性超图基准,含4领域10数据集,证明文本语义与结构共同提升超图学习性能。
Evo-Harness:面向自进化智能体的上下文到工具集的技能编译
Evo-Harness将嘈杂一次性执行编译为可复用技能集,实现智能体在线自进化,五个基准验证有效。
基于大语言模型的分层协调控制与延续感知策略学习
提出LLM分层协调框架,融合延续感知策略学习,在交通和能源管理中优于现有方法。
GraphLoom:多模态知识图谱RAG的可信校准图证据路由
GraphLoom通过可信子图检索与分层内存路由,减少噪声证据,提升多模态RAG的答案质量与证据忠实度,在三个基准上优于强基线。
LongDocBench:长文档中目录层级与上下文关系恢复的基准测试
构建长文档基准,含85篇真实文档,评估目录层级与上下文关系恢复,发现现有解析器能力有限。
思维漏斗:基于早期投票与轨迹剪枝的高效测试时扩展
思维漏斗保持投票精度且减半注意力计算,借犹豫标记剪枝无效轨迹,总成本降近三成,在线耗时降近四成。
ACTS-SQL:基于大语言模型的智能体与批判导向树状SQL正确性框架
提出免训练的树状SQL纠错框架,支持多策略回溯与执行验证,在基准上提升9.42%,并在生产环境显著提高准确率。
Validation-Frontier Representation Selection under Constrained Observation
StateM:通过执行框架扩展,在Terminal-Bench 2.1上达到95.3%原始准确率,或实现15美元的前沿运行
StateM以状态化运行与可恢复手册扩展执行框架,提升终端测试准确率至95.3%,成本约15美元。
二阶政策效应作为状态转换:政策模拟的源链接基准
政策二阶效应基准含96案例与状态转换变量。模拟器副作用召回优于基线,转换状态变量增强对下游制度效应的敏感性。
量化智能体的剖析:代码合成智能体工作负载中的显存稳定性与预测
量化智能体显存预测研究中,闭式模型加经验常数即可媲美学习模型;显存方差低,无需复杂预测模型。
治理干预下的平台适应:行为主体最优反应建模与外部公共案例基准
提出平台适应模型评估治理干预,经72个案例验证优于对比方法,主张政策应视为适应性干预而非静态控制。
ReForge:借助经验证的大语言模型编辑,让ABR算法永不停滞地适应变化
ReForge用大语言模型按轮改进ABR模糊规则,经历史回放验证。在3G到5G网络流上,平均QoE从1.23升至1.74,达神谕94%,且能修复未见网络。
VibeWorlding:多模态智能体能端到端构建3D开放世界吗?
提出VibeWorlding框架,训练多模态智能体自主构建3D世界;实验显示前沿模型成功率不足60%,强化学习可提升开源模型性能。
面向自动化领域建模的标准化评估:引入基准数据集
提出领域建模基准,结合UML与参考数据集,评估规则及LLM方法,支持标准化比较。
发散-收敛推理:通过结构化方案合成扩展测试时计算
提出发散-收敛推理两阶段法,单步收敛放大少数正确,递归DCR以更少算力达高精度,分歧度可预测推理收益。
ReasonCast:具有选择性语义推理的智能体需求预测
提出结构化语义干预框架,按需推理事件知识,选择性修正预测,显著降低假日与促销场景预测误差。
面向异构多任务语义通信的去中心化联邦学习
提出个性化去中心化语义通信框架,用任务亲和度共识矩阵和策略路由抑制负迁移,推导最优聚合深度,性能提升4.77%
$D^{2}R^{2}$:调控强化的离散扩散用于单细胞扰动预测
D²R²将单细胞扰动预测重构为调控引导的逐基因生成,利用离散扩散与强化学习优化生成顺序,取得最优结果。
多样性、公平与包容提示下医学语言模型的人口统计信息注入
DEI提示使医学模型添加未言明的患者人口统计特征,发生率由0.7%升至33.1%,且可致错误答案。
将医疗大语言模型锚定于因果知识图谱:框架、指标与心血管试点
提出以因果知识图谱为核心的评估框架,含四组件与自动评分,心血管试点显示集成条件因果和证据表现最佳,但无锚定时干预准确率最高。
理解智能体AI系统中认知引发的风险
从物理、社会、自我认知三层分析智能体AI风险,并提出缓解与可控性策略。
基准陷阱:AI评估中的权力与不公正结构
AI基准并非中立,而是塑造权力与不公正的结构性工具,奖励集中于产业实验室,阻碍领域良性发展。
多层前馈神经网络的集中性结果
多层前馈网络在权重分布趋于固定连续曲线、输入独立同分布时,输出以概率1收敛于常数。
FedPA-LoRA:面向异构联邦LoRA中聚合与初始化误差缓解的对齐乘积框架
提出FedPA-LoRA,通过对齐乘积空间聚合异构秩更新,兼顾局部连续性与全局一致性,在异构客户端秩下平均GLUE精度提升达6.82个百分点。