ARMS:面向稀疏奖励多智能体强化学习的自动奖励塑形
ARMS是首个基于博弈论均衡保持的多智能体自动奖励塑形框架,通过轨迹排序提高稀疏奖励下的采样效率。
HARNESS-LM:一种在赞助搜索检索中利用小语言模型的三阶段训练方法
三阶段训练框架将大规模检索能力迁移至紧凑模型,恢复98%精度,延迟降低27倍,吞吐提升20倍,在线收入增长1%。
LLMs as Noisy Channels: A Shannon Perspective on Model Capacity and Scaling Laws
CHRONOS: 时间感知的多智能体协同用于演化数据市场
CHRONOS三层架构通过神经ODE时间衰减、变化点Shapley定价和EXP3-IX隐私管理,实现高召回低延迟协同,隐私预算可控。
说服性与叙事性大语言模型解释下的人类决策
叙事解释未提升决策准确性,但增加AI依赖;高说服力叙事损害反应速度与辨别能力。
认知技能:关于知识与遗忘的推理
提出基于加权模型和认知技能指标的认知逻辑,建模知识获取与遗忘,并分析可知性与可遗忘性。
马尔可夫决策过程中的鲁棒反事实推断
本文提出闭式解法,计算所有因果模型下反事实转移概率的紧界,构建区间MDP并优化最坏情况奖赏,提升鲁棒性。
FATHOMS-RAG:多模态检索增强生成系统的思考与观察评估框架
提出评估RAG管道的基准,含93个多模态问题、短语级召回指标等,发现闭源管道显著优于开源。
遗忘敏感,铭记重要:持续学习中记忆塑造的令牌级差分隐私
PeCL框架用令牌级差分隐私保护敏感词,通过隐私引导记忆模块遗忘敏感并保留重要,平衡隐私与效用。
Ax-Prover:数学与量子物理定理证明的深度推理智能体框架
Ax-Prover多智能体系统,结合LLM与Lean工具,实现数学与量子物理定理的自主或协作证明,性能领先。
连接AI与临床推理:针对关键症状对齐的溯因解释
利用溯因解释确保AI推理与临床框架对齐,提升诊断可靠性和信任。
MUSEKG:博物馆藏品知识图谱
MuseKG将博物馆异构数据整合为可查询的知识图谱,支持自然语言查询与关系探索。
ALIVE:通过对抗学习与指令性言语评估唤醒大语言模型推理能力
ALIVE框架用对抗学习与言语反馈将外部评判内化为推理能力,超越标量奖励,显著提升准确率与泛化性。
NeuroWeaver:一种用于探索脑电图分析流水线编程空间的自主进化智能体
NeuroWeaver自主进化智能体,通过领域约束优化脑电图分析流水线,轻量高效,性能媲美大型模型。
MindLoom:组合思维模式以合成前沿级推理数据
提出MindLoom框架,通过组合思维模式合成前沿级推理数据,提升大模型推理能力,在多个基准上表现优异。
The Shape of Testimony: A Scalable Framework for Oral History Archive Comparison
AOP-Wiki EMOD 3.0:数据模型扩展与内容评估框架——利用主体性AI加强AOP与新方法学的整合
提出AOP-Wiki EMOD 3.0原型,扩展数据模型,提升AOP的FAIR性与AI就绪性,改善AOP与NAM的整合。
A Causal Argumentation Method for Explainability of Machine Learning Models
Who Uses AI? Platforms, Workforce, and AI Exposure
什么是AI奉承?一个破碎概念的分类法与专家调查
AI奉承缺乏统一定义,分类法区分观点与人格维度及显隐行为,专家调查显示对具体行为认定分歧大。
Trace2Skill:验证器引导的技能进化用于长上下文EDA智能体
Trace2Skill利用验证器反馈和轨迹挖掘引导技能进化,无需微调,显著提升硬件智能体在复杂Verilog设计中的成功率。
日志即智能体:用于可审计、可分叉的智能系统的事件溯源反应式图
ActiveGraph以事件日志为真相源,图是日志投影,行为响应变化,实现确定性重放、廉价分叉与端到端血缘。
一种面向多模态非合作无人机感知的相机协作ISAC框架
提出相机协作ISAC框架,融合视觉与回声,降低波束转向开销71%,缓解感知与通信资源竞争。
沿本体连续体的知识图谱重构(扩展版)
提出本体连续体理论框架,通过正交维度描述KG空间,为神经符号集成与重构提供基础。
ExComm:用于容错智能体测试时间扩展的探索阶段通信
ExComm通过审计信念状态、检测解决事实冲突,结合软更新与轨迹多样化,有效抑制错误传播,提升扩展性能。
ArborKV:面向树状LLM推理扩展的结构感知KV缓存管理
ArborKV通过结构感知驱逐框架,减少树搜索中KV缓存峰值内存约4倍,保持精度,支持更大搜索配置。
适配接口而非模型:面向确定性LLM代理的运行时框架适配
Life-Harness通过运行时框架适配接口,不改模型权重提升冻结LLM代理性能,平均相对提升88.5%。
Measuring Cross-Modal Synergy: A Benchmark for VLM Explainability
LLM-Metrics:通过大语言模型记忆衡量研究影响力
新指标利用大模型记忆评估论文影响力,与引用显著相关,2024年论文更强,小模型更优。
CLORE:面向推理效率的内容级优化
CLORE通过内容级编辑优化推理效率,减少冗余,提升准确率-效率权衡。
SGR-Bench:在状态门控检索上对搜索代理进行基准测试
提出SGR-Bench基准,测试搜索代理在状态门控检索能力,最强系统F1仅66.18%,失败主因是检索范围漂移和标准不匹配。
基于优先级排序的操控优化器直接评估方法
提出通过优先级排序低成本直接评估优化器,排序性能可预测其实际优化能力。
KAPPS:面向循环工厂的基于知识的CPPS架构
提出KAPPS架构,基于知识图谱实现循环制造动态重配置与事件驱动规划,支持约束执行和人机知识交换。
面向知识图谱数据集成管道的评估
提出KGI-Bench基准,用覆盖率、正确性和一致性评估知识图谱集成管道,并比较12种管道。
Meta-Soft:利用可组合元标记实现保留上下文的KV缓存压缩
提出Meta-Soft动态压缩框架,通过可学习正交基和选择网络合成软令牌,结合注意力流整合保留丢弃上下文,性能超越现有方法。
中文标题
将智能体工作流编译为LLM权重,以极低成本实现接近前沿质量,解决编排框架高成本与隐私问题。
LACO:面向协同驾驶的自适应潜在通信
针对协同驾驶中语言通信高延迟与信息损失问题,提出LACO潜在通信范式,降低延迟并保持性能。
S2ED:从故事到可执行描述,实现一致性感知的故事插图
S2ED无需训练,将故事转为可执行描述,提升多帧插图一致性,实验优于强基线方法。
用人工智能预测科学进展
研究引入CUSP基准,发现AI预测科学进步存在系统性局限和过度自信。
Spreadsheet-RL:基于强化学习提升大语言模型智能体的真实电子表格任务能力
Spreadsheet-RL框架通过强化学习微调,在真实Excel任务中使LLM的Pass@1提升超10个百分点,展现显著性能提升。
不确定非线性系统参考跟踪中的快速自适应元学习方法
针对不确定非线性系统参考跟踪,提出基于iMAML的元学习框架,利用源系统数据实现快速自适应,提升控制性能。
基于主观逻辑的安全论证运行时置信度更新方法
提出基于主观逻辑的动态置信度更新方法,集成设计证据与运行时安全指标,对违规及时惩罚。
Is Capability a Liability? More Capable Language Models Make Worse Forecasts When It Matters Most
超越组织架构图:AI与隐形工作的变革
AI改变正式角色及非正式文化实践(如导师制),带来协作便利但威胁职业发展机会,需让隐形工作更可见。
MOSS:自主智能体系统中的源级重写自我进化
MOSS通过源级代码自重写,自动批处理生产失败证据并验证,实现无人工干预的性能提升。
Towards a General Intelligence and Interface for Wearable Health Data
AI会加剧冲突吗?LLM部署在冲突场景中的对齐失败
AI模型在冲突地区部署可加剧矛盾,测试失败率高达47%,需警惕对齐失败。
用于随机作业到达的柔性作业车间调度的深度强化学习
提出事件驱动深度强化学习,采用PPO和MLP选择调度规则,最小化总完工时间,优于传统方法。
利用AI驱动的形式证明搜索推进数学研究
AI形式证明搜索自主解决9个Erdos问题与44个OEIS猜想,成本数百美元,展示强大能力。
LCGuard:面向多智能体系统中安全KV共享的潜在通信守卫
LCGuard通过对抗训练学习表示级变换,减少KV共享中的敏感信息泄漏,平衡安全与性能。