技能价值几何?结构感知的智能体技能 Shapley 估值
提出结构感知Shapley技能估值法,评估内部单元,区分内容与上下文成本,支持安全剪枝。
A/B Agent:面向工业A/B测试中策略迭代的自进化智能体
提出A/B智能体闭环,用层级经验树与Tree-RAG生成策略,据在线反馈自进化,GMV提升4.829%
一致性先于多样性:异构语言模型协同的验证优先互补性
ABD规则:锚点答案获两项印证则保留,否则异构合成;理论界定精度差距,实验提升显著。
延迟容忍网络中基于强化学习的无人机飞行与机会路由联合优化
提出JUROR,PPO联合优化无人机飞行与机会路由,集中训练分散执行,优于PRoPHET和MaxProp。
校准人工内疚:基于神经信号的亲社会多智能体强化学习奖励塑形
用人类fMRI数据标定内疚权重,嵌入多智能体奖励塑形,使智能体行为最接近人类选择(KL=0.0012)。
法律翻译的AI素养:培养数字韧性
生成式人工智能重塑法律翻译,提出含基础、程序、批判、战略四维度的AI素养框架,培养数字韧性并探讨教学应用。
基于ASRS报告的可追溯LLM生成航空系统运行安全危险场景
提出AI方法从ASRS生成可追溯危险场景,结合结构假设与叙事,进化溯因混合变体提升正确性。
ContextWeave:真实世界工作流基准
提出工作流记忆基准,基于14人多月数据生成千余任务,验证记忆提升下游性能,最佳配置显著提高得分,并揭示可执行记忆优于摘要但易受误导。
OctoLong:跨仓库代码上下文的中期训练增强长上下文建模
提出OctoLong管道,构建依赖丰富的跨仓库代码上下文,中期训练提升长上下文与代理任务性能。
当共享回放在防御性驾驶评估中失效:NAVSIM评分基准审计
审计NAVSIM发现数值不稳定致共享rollout失败,使盲探针异常高分,须披露评分依据并做稳定性测试。
从比分矩阵到足球感知的赛况模拟:一个可审计的LLM框架用于精确比分重排序
提出可审计混合框架,结合动态泊松模型与LLM上下文推理,按赛况逐球模拟提升比分预测。英超150场测试中,Top-1准确率从10%升至14.7%,但新增尾部候选无命中。
面向AI安全的项目反应理论
用项目反应理论分析192个模型在8个安全基准上的表现,发现三项核心因素,可精简评估项、降成本,并检测作弊。
CoPlan:基于角色化可争议论证图的可信协同护理规划智能接口
CoPlan提出多智能体协同护理规划接口,支持人类增删改论证,实现可审查、可争议的人机决策,保障人类主导与临床问责。
EDATracer:用于大规模EDA工件分析的主体框架
提出EDATracer主体框架,结合知识图谱与向量索引,分析EDA工件,在90题基准上准确率优于Cursor和Claude Code,且节省2-3.2倍令牌。
Argus:用于长时程推理的通用智能体运行时
Argus是持久自进化运行时,分离意图与目标,经验证门控进化,基准性能提升且降低开销,支持长时程推理。
RAG-Stack:联合优化RAG服务性能与质量
提出RAG-Stack框架,高效探索RAG应用的质量-性能帕累托前沿,无需逐个部署即可搜索算法-系统配置并迁移优化结果。
基于AI的多模态表示学习揭示社会经济劣势、心理社会因素与心血管代谢共病的潜在中介结构:来自All of Us研究项目的启示
AI框架分析2万余人数据,发现心理社会脆弱性是连接社会经济劣势与心血管代谢共病的关键潜在中介路径。
AutoProteinEngine:用于蛋白质工程中多模态自动机器学习的大语言模型驱动智能体框架
提出AutoPE框架,使无深度学习背景的生物学家用自然语言实现蛋白质工程多模态AutoML,自动完成模型选择、超参数优化与数据检索,性能显著提升。
智能体AI系统中执行风险治理:轨迹引导的红队测试框架
提出轨迹引导红队框架以发现智能体漏洞,运行时治理层将攻击成功率降至近零并保持任务效用。
迈向法律人工智能的新推理语法:以梅塞莱为语义协议
针对法律推理危机,提出梅塞莱姆语义协议,视法律为动态本体架构,融合神经符号与知识图谱,实现可审计的意义生成。
NuclearDiffusion:面向核能概念学习的文本到图像基础模型
微调扩散模型提升核能文本到图像生成,效果因架构而异,领域专用微调优于商业通用模型。
从叙事重建持久世界以驱动交互体验
提出从叙事描述重建显式持久世界作为核心目标,原型验证其可生成可玩游戏,支撑连贯交互体验。
CheckOne:视觉Transformer的轻量级故障检测与缓解
针对视觉Transformer,提出CheckOne轻量级故障检测与缓解方法,降低计算成本,关键故障缓解26倍,性能较ABFT提升3.8倍。
AgentAntibody:防御提示注入的LLM代理自适应免疫系统
AgentAntibody提出自适应免疫,从经验学习用户边界以抵御提示注入,优于现有防御。
FBID:面向物联网网络鲁棒分布外攻击检测的自适应个性化联邦学习
提出FBID框架,用服务器端上下文多臂老虎机调节本地训练,结合信任混合系数,在异构物联网下提升分布外攻击检测率与F1分数,增强鲁棒性。
采用边界框几何的可解释模糊推理用于无人机目标跟踪
基于边界框特征的可解释模糊推理,无需几何建模,误差小,透明高效,适用于无人机实时目标跟踪。
InvFlowFD:基于流匹配反演的无参考、无背景集音乐感知质量指标
提出流匹配反演的无参考无背景集音乐质量指标,比较逆样本与先验分布,与人类感知高度相关。
信息物理系统中LLM智能体规划策略的战略性评估
提出物理约束基准,评估LLM规划架构;架构显著影响结果,执行保真需超越模式一致性。
三叉戟:如何攻破深度强化学习网络防御(智能体式)?
三叉戟框架利用RLVR与代码即策略,使DRL防御性能平均降低522%,并发现诱饵规避等新兴行为。
EA-Graph:上游漂移下编码代理的工件锚定验证记忆
EA-Graph工件锚定验证记忆,区分上游变化后的受影响/未影响/不可证明状态,提升小模型判断,避免捏造内容。
MIDAS:多LLM迭代数据自适应摘要
针对企业摘要需严格遵循领域规范的问题,提出MIDAS框架,无需人工提示工程即可自动适配多种摘要要求,显著提升各项指标。
指南针:通过情境反思持续校准社交媒体信息流
指南针系统在浏览中轻量提示反思,周期性调整信息流以匹配用户深层偏好,实验显示更对齐且不失休闲体验。
COMPAS:面向代码生成优化的难度感知联合搜索
提出COMPAS,难度感知联合搜索模型、提示与解码设置,提升pass@1至52.8%并大幅降本。
基于约束混合策略GroupDRO的公平系统提示选择
用约束混合策略GroupDRO选提示词,最小化最差损失且保持平均质量,五个LLM最差指标平均降约13%。
FinReportBench:衡量与改进机构级金融报告生成
构建机构级金融报告生成基准,用专家规则评估,发现身份与完整性瓶颈,技能蒸馏可提升质量。
HyPASE:基于双曲几何的大型音频语言模型参数高效语音情感微调框架
提出双曲几何参数高效微调框架HyPASE,用于语音情感识别,超越欧氏基线且零样本泛化鲁棒。
对抗智能体系统中的知识腐化:一种拜占庭容错的安全协作RAG框架
提出SecureCollaRAG,多源知识验证与动态GNN评分,防知识污染,保领域完整,非独立同分布下鲁棒。
规则手册下的近似多目标搜索
提出ε规则支配,用于规则手册近似多目标搜索,高效求得紧凑解集,保证覆盖所有最优解,速度快两个数量级。
D²F-ReAG:面向多跳推理增强生成的动态分解与过滤
针对多跳问答,动态判断根推理可靠性,不可靠时分解为子问题并验证优化,提升准确率与效率。
MERaLiON-GR:面向英语与东南亚语言的语音性别识别模型
MERaLiON-GR通过LoRA微调和ECAPA-TDNN,在8种语言上超越现有模型,性别识别更准。
ExeCRE:面向自修正代码生成的执行一致性引导可靠性估计
ExeCRE通过分析随机输入的执行输出一致性估计代码可靠性,减少误导反馈,提升自修正代码生成。
EuroExec:前沿语言模型在欧洲高管决策任务中未达专家水平
对413项欧洲高管任务测试六个前沿LLM,最强仅解决56.9%,专家参考答案近满分,74%排名更优,AI远未达专业标准。
GUARD:面向扩散视觉语言动作模型的基于不确定性消除与消融的风险检测
GUARD无需修改预训练策略,通过消融视觉语言键值缓存并比较去噪响应,实时检测动作预测与多模态证据的弱关联,跨策略、任务、实体和领域实现可迁移的失败信号。
面包屑式搜索智能体
搜索智能体易受媒介协调攻击,新策略ACH构造伪证据链,攻击成功率55.9%;TGSE自动改进策略,达71.4%。
掩码扩散实现连贯节拍跟踪
提出掩码扩散节拍跟踪法,经迭代推断建模多输出,减少异常行为,提升性能。
当缺失成为证据:评估大语言模型对完整性敏感的否定推理
CROWN-QA显示:大模型缺乏完整性敏感否定推理,常将证据不足判为否定,过度闭合,提示难以消除。
EASy:迈向高效的基于LLM的智能体系统
提出强化学习智能体框架,联合优化性能与效率,采用能力成本感知编排和里程碑规划,实现更优权衡。
顺序即保障:验证预算下的静态优先学习式代码删除
用排序调度冗余代码删除,静态优先保覆盖不减,模型扩搜索,执行验证掌最终删减。
易于完成,难以选择:探究LLM在ProverbIT基准上的表现
意大利谚语基准测试显示,LLM虽能补全谚语,但在无正确选项的多选题中表现骤降,暴露依赖记忆而非深层语义理解的局限。
主动式SWE:无问题报告场景下的编码代理主动缺陷修复基准
现有编码代理依赖问题报告修Bug,但报告常缺失。新基准Active-SWE含1663项多语言任务,评估代理主动发现并修复多个Bug,结果显示现有代理表现不佳。