Correcting Split Selection in Online Decision Trees via Anytime-Valid Inference
熵投影对齐:估计、解释和提升分布偏移下的模型性能
EPA框架通过矩匹配与KL散度最小化,统一解决分布偏移下的性能估计、解释与提升,高效鲁棒。
DeMaVLA:面向可泛化形变操作的视觉-语言-动作基础模型
DeMaVLA通过流匹配和剪枝高效生成动作,结合大规模预训练与DAgger纠错,实现可泛化形变操作。
采用≠适应:野外LLM对话的纵向分析
纵向分析揭示个体用户习惯难改,活跃用户任务更复杂,WildChat数据偏向高级用户,不代表典型交互。
评论街机:论LLM评论的人类对齐性与可游戏性
LLM评论文与人类对齐有限,且差异大;作者可通过迭代修改“游戏”系统,使多达35%论文分数显著提升。
超低影响封装式采伐(URIEL):提出一种利用空中机器人系统在热带森林中进行选择性可持续采伐和采后营林处理的新方法
URIEL法结合直升机与无人机AI,几乎消除森林附带损害,经济可行,需多方利益整合。
前沿基于LLM的智能体能够克服自然表型本体整理瓶颈
五个LLM智能体在表型注释基准测试中表现接近人类专家,优于传统NLP工具,有望突破本体策展瓶颈。
扩散模型的正交概念擦除
OCE通过正交变换精准擦除概念并保持生成能力,4.3秒可擦除100个概念。
VFEAgent:一种用于端到端自动有限元分析的多模态智能体框架
VFEAgent通过多模态理解和验证优先代码合成,从图像自动生成可靠有限元仿真。
BEAMS:人工智能建模与模拟的基准评测
BEAMS倡议建立以人为本的AI建模基准,测试发现AI在讨论和定性任务优于因果推理与定量纠错,无单一LLM占优。
当模型产生分歧:重新思考用于公众评论分析的LLM评估
提议用多模型分歧评估LLM对公众评论的分类,发现分歧大于提示变化,主张分歧评估补充准确度。
基于智能体AI、嵌套学习与语义缓存的幻觉缓解
采用HOPE启发嵌套学习与语义缓存,多代理管道实现THS降低31%-36%,缓存命中率47%,提升可靠性与可持续性。
带外元数据对安全自主智能体的重要性:Redpanda代理数据平面
提出Redpanda ADP架构,通过带外元数据通道强制执行安全治理,确保代理无法绕过。
通过执行语义弥合基于强化学习的工业调度中的模拟现实差距
提出执行与测量层,构建决策快照、定义执行合同、记录分歧,将执行不确定性转化为监督数据。
基于潜在推理的鲁棒高效安全护栏
COLAGUARD将安全推理转入潜在空间,性能持平显式推理,速度提升12.9倍、token减少22.4倍,实现鲁棒高效护栏。
The Chain Holds, the Answer Folds: Trace-Answer Dissociation in Reasoning Models Under Adversarial Pressure
中文标题:课程定制:通过动态数据-模型兼容性实现以学生为中心的推理蒸馏
中文摘要:提出数据-模型兼容性(DMC)指标,评估数据集与学生模型的适配度,动态选择数据可提升推理蒸馏性能。
管理代理型AI系统的技术债务
定义代理技术债务与随机税,区分存量与流量,提出轻量级治理方案。
超越共识:多智能体混合中的推理轨迹合成
聚合推理轨迹优于多数投票,通过语义扰动生成多样轨迹实现更优纠错与合成。
置信度捷径:掩码扩散模型的推理失败模式
置信度解码与逻辑推理不匹配,导致复杂任务中高置信度错误,随机掩码可避免。
PRO-CUA:面向计算机使用代理的过程奖励优化
提出PRO-CUA框架,通过步骤级强化学习解耦交互与优化,结合过程奖励模型实现密集信用分配,高效训练计算机使用代理。
GTA:大规模生成面向Web代理的长周期任务
提出GTA框架,自动化生成带轨迹的多跳Web任务,构建基准揭示人机性能差距。
可证明安全的智能体护栏
基于逻辑推理局限性提出新安全范式,引入可执行证明约束动作框架,实现零攻击成功率和零误报率。
DenseSteer:引导小型语言模型进行密集数学推理
DenseSteer通过推理时调控表示实现密集推理,有效提升小模型数学推理准确率。
When and How Human Curation Backfires: Preference Alignment under Multi-Model Self-Consuming Loop
协调实时约束与长视野推理:一种面向动态调度的异步智能体框架
提出异步智能体框架RACE-Sched,双流架构解耦实时执行与LLM推理,协调实时与长视野,动态调度性能更优。
索引不可读之物:面向LLM原生的服务分类分层递归构建与搜索
A2X通过自动构建服务分层分类树实现逐层检索,以1/9的token成本提升命中率6.2%,超SOTA基线20点。
CoHyDE: LLM改写器与稠密编码器的迭代协同训练用于工具检索
CoHyDE协同训练编码器与LLM改写器,在工具检索中提升标准查询2.5%、模糊查询6.3%的NDCG@5。
扩展单语义性:从Claude 3 Sonnet中提取可解释特征
从生产级模型中成功提取多语言多模态可解释特征,可引导行为,但特征不完整且缺乏严格评估。
EvoMD-LLM: 学习反应分子动力学中物种演化的语言
将反应分子动力学转化为符号时间语言,使LLM学习物种演化,减少幻觉并能生成带有化学知识的解释。
基于评分指南的步骤模型路由过程奖励
RoRo框架通过评分指南过程奖励优化步骤模型路由,提升准确率与成本平衡。
MiraBench:评估机器人世界模型的动作条件可靠性
MiraBench基准评估机器人世界模型动作可靠性,发现视觉保真度不代表动作保真度,模型规模无益,乐观偏差普遍。
基于熵-KL散度的令牌掩码:一种选择性微调大语言模型的新方法
提出EKSFT,通过掩码高熵或高KL散度令牌,在低数据下保持预训练分布,提升数学推理与后续RL性能。
对齐但脆弱:通过零阶优化增强大语言模型的安全鲁棒性
从优化器视角提出零阶微调增强安全鲁棒性,少量步骤即可提升且聚焦关键层。
Opt-Verifier:通过双端验证释放大语言模型在优化建模中的力量
提出双端验证框架,从结构和解两方面验证,将优化模型准确性提升超20%。
ReasonLight:一种多模态基础模型增强的强化学习框架,用于零样本交通信号控制
ReasonLight利用多模态基础模型增强强化学习,通过视觉语义对齐实现零样本交通信号控制,减少紧急车辆等待时间88.7%。
帮助的诅咒:通过DistractionIF发现对干扰指令鲁棒性的逆缩放定律
LLM越大越易被干扰指令误导,强化学习可提升鲁棒性达15.5%。
电池模拟智能体:利用大语言模型智能体进行电池参数逆向估计
提出Battery-Sim-Agent框架,用LLM智能体闭环推理实现电池参数逆向估计,优于传统优化方法。
Beyond Attack Success Rate: Temporal Logit Observability for LLM Safety Failures
ParaTool:将工具表示从上下文转移到参数中
ParaTool将工具知识编码为独立参数模块,动态集成后无需上下文文档即可调用工具,性能更优且计算复杂度更低。
基于场景自探索的视图规划
提出自探索与视图图蒸馏迭代框架,解决VLM视图规划短板,性能从2.5%跃升至47.8%,超越GPT-5.4等。
快速思考,智慧表达:针对结构化健康文本生成的确定性与神经计算分离
将重复分析交给确定性代码,LLM仅表达已验证事实,降低错误与成本。
PTCG-Bench:大语言模型智能体能否精通宝可梦集换式卡牌游戏?
基于宝可梦卡牌游戏评估LLM智能体决策与自我进化能力,发现持续进化困难且对框架敏感。
GRASP:面向自改进LLM智能体的门控回归感知技能提议器
GRASP通过有界技能库和硬回归预算,提升LLM智能体性能达17-40点,超越基线21点,技能可跨模型迁移。
通过基于偏好的最大可满足性实现大型语言模型的可靠推理
提出LLM生成代码编码为偏好MaxSAT问题,由精确求解器求解并验证,显著提高推理正确率,超80%接受率。
从XXLTraffic到EvoXXLTraffic:将交通预测扩展到传感器演变的网络
提出EvoXXLTraffic数据集,反映真实道路传感器演变场景,挑战现有SOTA方法。
面向跨建筑能量预测的不确定性感知迁移学习:迈向稳健且可扩展的区域级能源管理
提出基于TFT的不确定性感知迁移学习框架,引入TRI指标,仅微调输出层效果最优,预测区间覆盖93.2%。
中文标题:为什么专家模型仍然重要:面向医学人工智能的异构多智能体范式
通用与专家模型协同显著优于单独使用,专家模型在医学AI中不可替代。
基于Transformer的EEG基础模型中位置编码策略的基准测试
评估五种位置编码策略,发现最优策略因任务而异,无通用方案。
驾驭大型语言模型中的非对抗鲁棒性
通过去偏微调快速提升LLM对随机提示扰动的鲁棒性,无需昂贵重训练。