更多的欺骗:混合动机大语言模型多智能体系统中的目标错位
目标错位破坏LLM多智能体集体决策,内部策略变化隐蔽于公共行为,需警惕其影响。
探析推理性能的根源:RL与SFT微调模型在数学问题解决中的表征质量
RL模型优于SFT源于更线性可分的表征和深层关键架构,但token分配变异性更多依赖训练流程。
ClinLens:面向纵向多模态临床数据科学的长期编码智能体
CLINLENS基准测试200个纵向多模态临床数据任务,最强模型仅56.3%通过率,揭示可运行提交与正确分析间的巨大差距。
基准推理的不可组合性:AI评估中的可投射性
提出非组合原则:相邻推理的支持需端点对齐方可组合,否则易失效。
CaM-Wolf:面向社交推理游戏的因果感知多模态智能体
CaM-Wolf率先将多模态感知与因果推理引入社交推理游戏,显著提升AI表现与人机交互质量。
GuideSkill:面向基于指南的临床推理的可进化执行式LLM智能体技能
将指南规则编译为可执行函数,结合病例进化,模型无关地显著提升临床推理准确率与覆盖度。
评估分数是可消逝的知识主张
评估分数平均聚合导致信任膨胀,应视作含形式性、范围与有效期的声明,采用最弱链接聚合。
GoGoTB:基于规范约束覆盖闭合的代理式RTL验证
GoGoTB代理框架实现RTL验证端到端覆盖闭合,无需人工干预,平均线覆盖98.4%、分支97.2%、功能83.2%,超越先前所有工作。
TraceCoder:基于位置键片段版本化的可解释与可审计代码生成
TraceCoder通过片段历史与位置键索引实现代码生成的可解释和可审计,追踪率达30%,内部决策可回放。
探索物理问题中的结构:AI智能体能否发现统计力学映射?
评估AI agent发现统计力学映射能力,数值反馈可辅助但易误判,需结合符号验证。
UrbanDS: 一种图引导的LLM多智能体系统,用于数据密集型城市任务
提出图引导LLM多智能体系统UrbanDS,通过数据集图组织技能与关系,多智能体协作处理数据密集型城市任务,性能领先。
CG-World:面向世界模型的大规模世界状态数据集与协议
提出含85万段状态标注的CG-World数据集,支持干预学习与反事实推理,助力视频生成及策略迁移。
Eco3S:基于智能体的复杂社会经济系统模拟
Eco3S框架通过共演化环境、结构因果模拟和自改进机制,精准复现经济研究现象,支持政策分析。
多模态序列动机推理基准:MultivationBench
MultivationBench评估多模态序列动机推理,基于心理学框架,模型难以动态推理,暴露静态识别与动态理解的差距。
EvoPINN:基于智能体的物理信息神经网络可行算法发现
EvoPINN智能体自动发现PDE专用学习算法,显著降低L2误差,并自创SLRC-PINN新架构。
AlphaSchema:探索基于大语言模型阿尔法挖掘的交易语义空间
提出结构化语义空间解耦探索与实现,迭代选择平衡全局与局部,提升因子挖掘效果。
更少澄清,更好代码:编码助手中跨会话个性化歧义适应基准测试
提出CAPA基准,评估编码助手利用用户历史会话解决重复歧义、减少澄清次数的能力。
重新思考自我进化:一种缓解技能过拟合的受约束探索-利用过程
提出SkillBoost框架,通过结构化剥削与先验引导探索,在缓解技能过拟合的同时保持最优性能。
面向声明-证据可追溯性的证据账本裁决
证据账本裁决将声明与证据配对并评估支持关系,基准测试准确率0.676,优于基线,实现AI写作可审计追溯。
AgenticCANN:通过知识增强的智能体进化实现自动化的升腾C算子生成
知识增强智能体自动生成升腾C算子,可行性达90-100%,最高加速6.65倍
从被动视频到可编辑体验:面向具身智能的物理基础经验合成
通过图结构知识迁移,Pegasus将人类演示视频转化为机器人可学习数据,解决具身智能数据瓶颈。
SimpleWikiSearch:一个用于智能体搜索的干净离线维基百科环境
提供可复现的离线维基百科搜索环境,含明确语料构建、检索栈与评估协议。
AI智能体时代需要新的科学范式以维系可信科学
AI自主代理加剧科学验证鸿沟,需建立可观察、可扩展、可归因的验证范式,避免信任危机。
中文标题:识别基于LLM的聊天AI对智力障碍人士的隐性偏见
本研究对比分析AI生成故事,发现模型对智力障碍者存在年轻化、偶像化、依赖化等负面隐性偏见。
一种为机器人设计知识驱动任务的方法
本文提出在ROS 2中利用知识图谱设计自主机器人任务的方法,通过模拟搜救验证其提升效率与智能。
GuidedRAG:检索增强生成的语义引导
GuidedRAG在检索前用语义约束知识库,提升相关性14-15.8%,降低开销数个量级,泛化覆盖15种RAG变体。
认知趋同:大型语言模型与人类认知的深层相似性
LLM与人类认知在推理、架构、表征、学习和强化机制上存在深层结构对应,挑战“外来智能”观点。
IFCMemoryBench:评估基于LLM的智能体在BIM信息检索中的长期记忆
提出IFCMemoryBench评估LLM代理长期记忆,BIM检索中最强系统准确率仅32.4%,揭示领域转移鸿沟。
IDP AutoOpt:智能文档处理流水线配置的自主代理优化
自主LLM代理自动优化文档处理配置,成本降低4.6倍,配置时间从数周缩至两小时内,准确率超人工。
FinCacheServe:面向可变企业文档的高效RAG服务中依赖一致的答案复用
通过依赖一致性缓存,跳过53%以上LLM调用,零过时输出,比版本语义缓存节能44%。
封闭基础设施中氢气泄漏检测的传感器布局优化:基于CFD遗传算法与DeepSets神经代理的对比研究
结合CFD、遗传算法与DeepSets代理优化传感器布局,检测率达96.1%,盲区0.12%,计算成本降低89%。
GPT-Red:通过大规模自我对弈实现自动化红队测试
GPT-Red通过自我对弈算法训练,自动攻击前沿LLM,比人类更有效地发现攻击,提升模型鲁棒性。
再来一次,不要回头:盲重采样在小代码模型中优于自我修复
盲重采样在小型代码模型中优于自我修复,因模型锚定先前失败尝试,执行反馈无额外收益,自我反思成本高。
可信具身智能:一个系统框架与分级可信度等级
定义可信具身智能为持续安全成功,提出四层系统框架与分级可信度层次,用于评估部署可信度。
SARC-DQ:智能体AI的运行时数据质量门控——静默证据缺陷、无能护盾与仅下游修复
元数据缺陷致智能体60%错误动作,模型能力不增怀疑;元数据感知门控+下游修复合计损失,证据完整性独立于模型能力。
中文标题
提出认知诊断画像(CDP)零样本框架,使LLM模拟考生与人类在能力、画像、难度三维度对齐,校准精度显著提升。
Pramana:一个可组合的领域特定实证网络研究后端
Pramana通过意图规范解耦实验三轴,满足34%实验意图,效率超现有工具2倍,加速实证网络研究。
LLMET:面向能效LLM服务的新兴M3D存储器的跨层评估
提出LLMET框架,评估M3D大容量片上缓存对LLM服务能效影响,实验显示能耗降低可达44%。
面向对话式AI智能体的图原生双时态记忆存储
提出图原生双时态记忆存储,用Neo4j加向量索引,支持时间旅行检索,在长时记忆测试中部分问题召回率达80%。
共享符号骨架用于物理一致的多输出符号回归
提出共享符号骨架的神经进化符号回归,强制多输出物理一致性,在弱可识别时诊断跨输出一致性。
基于角色的利率行动指数
提出基于角色构建指数预测FOMC利率决策,角色行为可识别且内容逼真,指数追踪利率周期并领先约三个季度。
ServerlessT2I:在无服务器平台上高效服务于文本到图像工作流
ServerlessT2I分解文本-图像工作流为独立模型函数,实现高效调度与资源节约,支持2倍请求率或节省3倍GPU资源。
保护组织免受恶意软件风险:一种新颖的基于图的恶意软件检测方法
提出MalGuard图检测法,通过操作角色识别与程序图表示学习,提升检测性能并降低漏检成本。
MPEcho:一种旋律与音素感知的可控翻唱生成框架
MPEcho集成音素编码器和长度调节器,降低翻唱生成音素错误率,并开发Phonsa模型提升对齐精度。
编程智能体对开源社区AI贡献规则的合规性初探
智能体极少主动遵守AI贡献规则,仅在提示下完成披露与验证,但无法自主拒绝贡献或升级人工。
借力攻破:代码编码上的Best-of-N搜索突破自检越狱防御
组合代码编码与Best-of-N搜索突破最强自检防御SAGE,成功率67%,归因于防御借力目标模型自身判断。
零样本人脸到语音合成:基于风格扩散TTS模型潜在空间自适应
轻量适配器将人脸特征对齐到冻结StyleTTS 2模型,生成自然语音(UTMOS 3.7-4.0),且无需重新训练即可跨语言泛化。
基于注意力的静息态fMRI阿尔茨海默病分类框架
注意力框架直接建模rs-fMRI功能连接,AD分类准确率88.95%,AUC达0.90。
AI作为创意构思中反思支持的摩擦因素
生成式AI应作为反思的摩擦因素,而非输出平滑器,支持设计师构建与传达设计理由。