从智能体轨迹到信任:大语言模型智能体中的证据追踪与执行溯源
提出证据追踪与执行溯源框架,解决LLM智能体执行过程难验证问题,推动从结果正确性转向过程问责。
通过学会防御性推理对齐深层隐性偏好
提出CDRA方法,利用推理链和生成式奖励模型对齐用户深层隐含偏好,实现防御性推理,实验表现优异。
使用自适应和非自适应粒子群优化的多列RBF神经网络
提出MC-PSO和MC-APSO,并行RBFN结合PSO/APSO,提升准确率和召回率,训练测试更快。
自我反思API:结构优于冗长,助力AI代理恢复
AI代理遇API验证错误时,结构化建议提升任务完成率36.7-40个百分点,效率高1.8-2.2倍(Anthropic模型)。
破坏有害分子:多模态大语言模型能否实现结构级分子解毒?
提出首个分子毒性修复基准ToxiMol及评估框架ToxiEval,测试43个MLLM,发现其展现潜力但挑战仍存。
Evaluating Transformer and LSTM Frameworks for Prediction in Ungauged Basins
视觉图支架:提升大语言模型结构推理能力
图的价值在于组织推理而非仅提供信息;视觉图引导比文本化更有效。
不要赌博,GAMBLe:面向AI驱动研究系统的分析框架
提出GAMBLe框架分解ADRS为四参数一景观,实验表明组件选择可提升性能13-67%、效率6-39倍。
BehaviorBench:从行为轨迹中建模真实世界用户决策
BehaviorBench基于真实交易记录评估个性化决策建模,发现信念与交易预测效果因任务而异。
AURA:恒定显存下机器人策略的动作门控记忆
AURA-Mem以恒定显存(4224字节)实现机器人策略,通过动作误差信号门控写入,减少写入5-7倍且性能不变。
基于碰撞的敌人形态生成探索
基于碰撞信息提出三种敌人形态生成方法,性能均优于或等同于进化基线。
中文标题:面向边缘嵌入式AI智能体系统的模块化架构
中文摘要:提出模块化架构,解耦设备端与云端代理,集成治理层,分析资源受限下的延迟能量权衡。
大型AI模型在牙科医疗中的应用:从通用系统到领域特定基础模型
综述牙科AI三大模型类别,指出通用与专用互补,但面临幻觉、数据稀缺和缺乏标准评估三大障碍。
当帮助适得其反及如何修复:用于数据清理的多智能体辩论
辩论在数据清理中生成受批评混淆损害,但错误检测提升;对抗性分离实现生成任务首次超越单智能体。
从智能体轨迹中归纳推理原语
从ReAct轨迹中挖掘常见推理动作,转化为伪工具库,使性能大幅提升(最高+44个百分点)。
基准测试未能衡量的:论评估自主代理的弃权能力
指出基准测试忽视代理的弃权能力,提出三类弃权场景及评估方法,实验表明安全与可用性可调。
RelGT-AC:面向关系数据库自动完成任务的关系图Transformer
提出RelGT-AC,通过列掩码、统一任务头和TF-IDF编码,在关系库自动完成中超越GraphSAGE,回归任务全优,文本任务AUROC提升10点。
思考后再发言:从内部评估到公开表达的多智能体社会模拟
提出TBS框架,分离内部推理与公开表达,在模拟讨论中揭示内部评估影响发言意愿,公开表达受规则主导。
SkillDAG:面向大规模LLM技能选择的自演进类型化技能图
SkillDAG通过类型化有向图建模技能关系,提供推理时可查询演进的接口,显著提升LLM技能选择成功率。
GTBench:基于课程体系的图论数学研究助手评估基准
GTBench基准测试显示,GPT-5在图论推理中表现领先,其他模型随难度下降,人类与自动评估存在系统性分歧。
ClinicalMC:面向大语言模型的多病程临床决策基准
提出ClinicalMC基准,含中文1275、英文5804样本,评估多种LLM在多病程临床决策中的表现。
人口统计偏差对皮肤病变分类的影响
研究揭示性别偏差源于数据不平衡,年龄偏差始终偏向年轻群体,需针对性策略应对。
LEAP:用智能体框架大幅提升LLM在形式化数学中的能力
LEAP智能体框架利用基础模型能力,通过问题分解与Lean编译器交互,使通用LLM在形式化定理证明中达到SOTA,超越专业系统。
现实世界数据集是否包含自然实验?一项使用因果特征选择的实证研究
现实数据集存在自然实验,利用因果特征选择可提升模型性能。
在Pythia多跳设置中跨模型激活迁移的负面结果
测试跨模型激活翻译传递推理状态,高对齐度但注入无效,离线表征对齐不足以因果通信。
The Reliability Gap in Benchmark Auditing: Distribution Shift and Scale as Failure Modes of Contamination Detection
TSQAgent:通过专用代理推理评估时间序列数据质量
提出TSQAgent框架,通过三个代理角色识别质量维度并进行定量比较,显著提升时间序列数据质量评估与下游性能。
命题可废止立场逻辑中的非单调蕴涵研究
提出将非单调理性蕴涵提升至命题可废止立场逻辑片段的方法,利用情境条件句,复杂度不变。
SAGE:智能体生态系统中社会化演化的定量评估
SAGE框架发现,同伴历史能使陷入平台的智能体突破自我进化上限,但社会增益取决于抽象转移知识的能力,而非所有智能体都受益。
诊断大型语言模型工具使用中的知识缺口:面向新型API获取的智能体基准
新基准揭示:知识组件不可互换,使用示例最强;检索与微调互补,多余上下文有害。
DeepSpeak-Agentic数据集
提出37小时人机对话视频数据集,用于AI代理取证识别与人机交互研究。
通过推导图揭示Do-Calculus推理的结构
引入推导图描述do-calculus推理结构,简化规则应用至多四次,生成高效因果估计。
通过智能体对话危害识别分析增强运行安全性
HAZDIAL框架利用多智能体多轮对话提升危害识别,实验证明优于单次基线。
技能金字塔:面向自演化智能体的层次化技能巩固框架
SkillPyramid框架通过层次化技能巩固与自演化实现技能复用和动态演进,奖励提升38%,步骤减少27.7%。
Dynamic Objective Selection with Safeguards and LLM Oversight for Financial Decision-Making
图编码:基于知识图谱的大语言模型迭代式编程推理
CoG将KG模式转为Python类并生成可执行代码推理,避免直接注入知识,性能提升10.5%。
Proof-Refactor:将生成的正式证明重构为模块化制品
提出Proof-Refactor框架,四阶段重构LLM生成的证明,显著提升可读性与模块化,优于长度优先基线。
何时重新规划:分层潜在推理中的子目标持久性
分层潜在推理中,适中子目标持久期(P≈3)与对齐权重(λ≈0.05)最佳平衡稳定性与适应性,实现有效组合规划。
从控制边界到保险索赔:通过CER框架重建AI中介损失
CER框架通过控制边界、证据重建、保险响应三要素,诊断AI残留风险转移,辅助损失重建与保险索赔。
LAP:面向自主科学的智能体-仪器协议
LAP填补智能体-仪器协议空白,以仪器卡、独占保留、安全围栏和物理类型测量结果实现自主科学闭环。
利用BART基于评分标准评估CS1 C++编程作业
研究利用BART多任务微调自动评分,结合评分标准和软标签,比通用模型更贴近教师评分行为。
基于遗传优化的稀疏道路观测城市交通仿真校准
提出遗传优化框架,仅用稀疏道路观测校准城市交通仿真,无需就业数据,生成与实测高度相关且可泛化的仿真,工作分布合理。
Samudra 2:跨分辨率扩展海洋仿真器
Samudra 2通过改进神经网络架构与动态损失,显著提升海洋仿真精度与分辨率,支持多年滚动预测。
TadA-Bench:面向智能体蛋白质工程未来轮次发现的百万变体基准
TadA-Bench是百万变体湿实验回放基准,基于31轮定向进化,用于智能体蛋白质工程未来轮次发现。
边缘博弈:用于巴西赤道边缘区域公共政策分析的多智能体系统
提出Margin Play多智能体系统,模拟巴西赤道边缘石油勘探政策冲突,发现公共体制选择是核心而非简单权衡。
FSA-GRPO:教听觉大语言模型使用少样本演示
提出FSA-GRPO强化学习方法,通过奖励机制增强听觉大语言模型少样本适应能力,在低资源任务上显著有效。
振荡状态空间模型作为物理信息神经偏微分方程求解器的归纳偏置
引入振荡状态空间动力学表示模态结构,提升PDE求解精度并降低内存消耗。
具有校准遵从能力的闭环分子设计
CLIO代理通过校准遵从,在闭环迭代中设计AORFB负极液,电势提升130mV并诊断修复可逆性问题。
基于层次模体的多模态蛋白质嵌入增强蛋白质相互作用预测
提出MMM-PPI分层模体多模态编码器,从微观到宏观整合序列、结构、功能,显著提升蛋白质相互作用预测性能。
D-Judge:利用语义保留的输出重写瓦解多轮越狱攻击
D-Judge是一种语义保留的输出重写防御,通过扭曲攻击者评测信号破坏多轮越狱,显著降低成功率。