Agentic AI的兴起:演进、背景、工作原理、应用、采纳因素与未来研究方向综述
系统综述Agentic AI的演进、原理、应用与挑战,提出采纳框架,指出研究空白与未来方向。
现有模型卡不足以支撑开放权重基础模型的下游治理
开放权重模型治理需结合模型卡、使用政策与许可证三层机制,现有模型卡存在安全信息缺口,标准开源许可证亦不适用,需整合三者为综合安全工具。
飞行日志驱动的无人机螺旋桨健康监测之蜕变式人工年龄评分决策支持原型
提出多指标决策支持原型,用六个健康指标评估螺旋桨故障,经测试能区分不同严重度并触发相应维护措施。
立场:多智能体系统应优先重视并发控制
多智能体系统因并发读写共享状态而失效,应通过冲突检测与隔离保证等并发控制机制解决,并将其作为首要设计考量。
游戏世界迁移复杂度剖析
提出迁移复杂度剖面(TCP),量化游戏环境迁移预测难度,含分支、不确定性、依赖跨度指标,倡导作为GWM/RL论文标准元数据。
FinSkillBench:评估投资管理中的AI智能体与领域技能
投资管理需可靠技能,基准测试显示:精选技能提升模型得分(0.366→0.528),自生成技能收效甚微。
大语言模型在心理健康领域的应用:系统综述其应用、创新与伦理挑战
综述大语言模型在心理健康的应用、创新与伦理挑战,涵盖社交媒体分析、临床对话、多模态融合及安全部署。
自进化智能体作为动态图变换:综述与新视角
提出将智能体进化视为动态图变换,综述四类方法,并以动态图学习为基础设施,讨论评估治理。
立场:AI排行榜未能充分服务全球南方——以印度为例
AI排行榜缺乏治理机制,忽视全球南方基准,需建立独立治理的区域排行榜。
循环语言模型提升组合式工具调用
循环语言模型在组合工具调用中表现更优,增加循环深度可提高多步准确率,自适应推理能更高效权衡计算与性能。
安全对齐错觉:大语言模型的跨语言安全缺口
英语中心的安全对齐在非英语中失效,新基准INCLUDE量化印度偏见,发现孟加拉语开源模型偏见最高,英语在开源最低但闭源最高。
低资源语言中仇恨言论检测的LLM高效适配:罗马乌尔都语比较研究
罗马乌尔都语仇恨检测中,LoRA微调显著优于零样本,F1超0.93且计算高效。
评估开放模型在高风险公共部门应用中结构化信息抽取的表现
开源模型处理高风险管理文档多不达标,仅4/35配置F1超0.5,约75%低于0.25;输入质量比模型规模更关键。
测度部分得分差距:越南2025凸性评分方案的严格基准
标准基准按比例计分高估模型;越南2025高考凸性评分制下,答对三题只得0.5分而非0.75分,官方规则使模型得分与排名下降。
治理记录即监督:验证器筛选的自我训练用于结构化工作流修复
验证器筛选的自我训练利用治理记录,将接受计划从1提升至57,优于自选,支持受限可验证能力监督。
SESSE:草图、扩展、排序、总结、评估——基于结构化分解的LLM裁判评估
SESSE无需训练,将整体判断分解为结构化子问题,在基准上接近基线,并提供可解释审计轨迹。
ComponentBench:诊断计算机使用智能体的组件级失败
提出组件级基准ComponentBench,发现观察与动作空间导致成功率波动超30%,智能体速度远低于人类。
GenEx:基于密码子共现网络的SARS-CoV-2变异检测图表示范式
提出GenEx,将密码子序列转为共现图并提取特征,用奇异值平方增强分类,高效检测SARS-CoV-2变异。
大规模推荐解释中LLM评判者的生命周期
LLM评判者生命周期:构建、训练、部署、监控;用于Netflix推荐解释,提升新内容观看与播放转化。
锯齿前沿:评估代码智能体对语义保持变换的鲁棒性
代码智能体遇语义等价改写后,多数配置性能略降,鲁棒性因支架而异,前沿模型仍易受影响。
当干净信号不足:检测结构歧义以实现安全的可穿戴压力分类
提出的ICCM监测器可量化个体耦合差异,识别结构歧义,但仅轻度改善漏检,不能作为独立安全保证。
FACET:在终端任务合成中保留源意图与可执行状态
FACET通过共享可执行状态和保留源意图合成终端任务,微调后性能显著提升。
通过形式抽象提升资源受限语言模型的自然语言组合优化准确性
提出SDDL神经符号框架,将自然语言调度转为紧凑表示,提升小模型可行性至55.3%,优于直接生成与求解器代码基线。
哪些负样本重要?问你的文本编码器:密集字幕检索的自适应相似度边际
HN-CLIP用文本编码器的文本-文本几何构造自适应负样本边际,提升密集字幕检索,无需额外数据或开销。
FM-Bench:面向竞争智能体的长期管理基准测试
FM基准让语言模型智能体管理俱乐部20年,15个模型完成、脚本基线多失败;成绩由管理行为而非算力决定。
离线解释选择中成对排序优于单动作强化学习:实用经验
将生成与选择解耦,成对排序优于单动作强化学习,指标达0.5,成本约15美元。
FinRCA-Bench:金融AI系统证据检索与推理基准测试
2250例对账基准,15类故障,检索架构影响AI性能,正确标签≠审计诊断。
桥接搜索与CRM:将AI产品研究代理生产化以实现客户再互动
提出生产级人工智能产品研究代理框架,连接搜索与客户关系,识别探索性用户,推送个性化推荐,提升点击率与交易。
三余工作室:用于艺术史叙事建构的多智能体系统
提出多智能体对话系统,让用户与画作代理互动,生成多元艺术史叙事,增强人的能动性。
基于语义链接不确定性的省略三段论补全配对逻辑选择
提出PWAL方法,在语义链接不确定下支持省略前提/结论选择,提升准确率2.95-30.86个百分点,降低平局率,并透明追踪评分过程。
面向企业自动化分析与洞察生成的多智能体平台
提出基于CrewAI的五智能体流水线,实现对话式商业智能,准确率95.3%,无幻觉率93%,较单智能体显著提升。
RTPO:用于稳定智能体强化学习训练的逆回合策略优化
基于逆回合策略优化,通过反向更新消除上下文不匹配与异步漂移,稳定多回合智能体强化学习训练。
自写指标:从自身盲点进化评估器
自写指标通过反例引导从自身盲点进化出评估器,在编码基准上以少量标记达到接近完美过滤效果。
能力,而非准确率:技能优化中无参考评判器门控的诊断方法
无参考评判器门控诊断:判别力受能力约束,需能力大于答案空间倒数;非干预探针可预判门控错误。
自主提示与跨模型共识实现从科学文献中可复现的数据提取
前沿LLM按专家提示提取文献数据,自写提示效果接近专家,但自主检索易出错,需人机协作确保数据准确。
OWL类表达式的句法简化
提出CES算法,在保持语义的前提下简化OWL类表达式,减少冗余,提升推理效率与可读性。
DentAgent:以证据为中心的多智能体协同用于多模态牙科推理
证据为中心的多智能体牙科推理框架,整合多模态证据,性能领先,多标签诊断超越资深专家17.3个百分点。
打破最弱环节以逃避视觉语言模型
提出仅优化视觉编码器的梯度攻击,高效生成微小扰动,使多个开源VLM输出错误语义,揭示其脆弱性。
TestifAI:基于断层扫描的深度学习系统测试
提出TestifAI,用低阶扰动测试预测高阶组合鲁棒性,误差低于7%,推理减少60-80%。
事后辩论评判理论
提出事后辩论评判理论,比较了大模型评判与论证语义,后者更具形式保证,更适合辩论驱动AI。
自适应记忆与反思多智能体医学问答系统
提出自适应记忆与反思多智能体系统,利用专用记忆和反思反馈提升医学问答的准确性与推理能力,在基准测试中表现优异。
AI后训练中缺失了什么:一项实证分析
AI后训练中,智能体策略过早锁定,缺的不是经验、指导或推理,而是执行中自发重估策略的机制。
演化不确定性下的稳健风险:熵风险价值的Wasserstein对应
提出基于最优传输的熵风险价值,替代相对熵球以覆盖极端灾难,具对偶形式,随信念锐化风险收缩,实现安全切换。
GigaBrain-WBC-0.5:面向环境交互的鲁棒全身控制行为世界模型
提出人形机器人行为世界模型,联合预测动作、状态与命令分布,实现地形交互与鲁棒控制,四项基准最优,硬件验证有效。
覆盖驱动的RTL断言生成:形式探索与神经符号优化
提出NeuroAssertion框架,结合形式化探索与神经符号修复,断言数量和变异覆盖率达传统方法约2倍。
LEDGER:面向LLM智能体审计的声明-证据追踪图
提出LEDGER系统,将LLM智能体的执行轨迹构建为分层证据图,连接声明与支撑证据,提升审计效率。
跨主族并可外推超越训练规模的耦合簇分子性质
提出MEHnet-MG网络,由一次DFT算得哈密顿量,以耦合簇精度预测九种主族元素多种性质,误差降3.8至230倍,单分子约25毫秒,并能外推至更大体系。
罗曼诺夫三元组逻辑的形式化验证:面向滑动窗口3-CNF的验证过滤器及其在结构化公式中的应用
首次在Rocq中形式化Romanov三元组逻辑,验证滑动窗口3-CNF过滤及多项式界,明确正确性边界并实现原型。
低功耗神经形态声学异常检测,用于持续机器监控
基于Loihi 2神经形态芯片的声学异常检测,能效比CPU/GPU低两个数量级,适合低功耗持续机器监控。
网格细胞在减少海马位置表征中空间混叠的作用
引入网格细胞信号可显著减少空间混叠,较仅边界向量细胞基线降低94%-99%,尤其在高视觉对称环境中效果最佳。