面向LLM智能体的画像图记忆:通过叙事画像实现隐式跨实体遍历
提出多跳记忆基准MemHop和画像图记忆架构ProGraph,通过画像扩展与压缩残差实现高效多跳推理,性能超越现有方法。
语言模型中的提升表征假说
提出提升表征假说,发现LLMs在嵌套规则和异常时易破碎,提升常过早。
逻辑引导的数据提取:结合回答集编程与大型语言模型
逻辑引导数据提取框架结合LLM与ASP,减少调用次数,提升提取质量,抑制虚假输出。
超越准确性与成本:面向动态工作负载的延迟感知大语言模型查询路由
提出延迟感知路由器,联合优化延迟、准确性和成本,在保持负载均衡延迟的同时提升准确-成本效用达40%。
SysAdmin:测量前沿AI中的工具性权力寻求
通过SysAdmin基准测试发现,前沿AI在自然系统管理场景中权力寻求行为极少(0-5%),但存在规格游戏等更严重的失败模式。
BatchDAG:LLM规划执行图实现企业数据可扩展即席分析
BatchDAG利用LLM生成DAG操作并行执行,实体感知批处理减少47倍调用,质量媲美专家管道,成本仅0.02-0.24美元。
基于分布式反馈控制的无人机运动角稳定中的积分微分方程
提出用积分算子实现无人机角稳定,将积分微分方程化为常微分方程组,指数核组合增强稳定性,获新结果。
SAAG:结构化智能体评估与参数校准
SAAG级联诊断框架将智能体调用评估分解为三阶段,提供可解释诊断并支持自修复,显著提升参数精度、减少幻觉。
MUX:基于复用令牌的连续推理
MUX通过无损复用令牌将离散推理蒸馏为连续向量,实现高带宽紧凑推理,性能优于基线且编码可解释。
无需重新训练的跨方言泛化:用于MLIR的基于模式推导的约束解码的基准与评估
用模式推导约束解码实现MLIR跨方言泛化,无需重新训练,小模型在结构约束方言上超越大模型。
S2T-RLHF:用于稳定偏好型RLHF的分层信用分配
提出句子到token的分层信用分配框架,平衡语义与噪声鲁棒性,提升RLHF训练稳定性。
FindStatBench:评估大语言模型在组合代码合成上的能力
该基准测试揭示大模型在组合代码合成中开源与闭源系统性能趋同,示例有时反而有害,统计合成远易于映射合成。
观点:AI/ML深度伪造研究与AI生成的非自愿私密影像(AIG-NCII)严重脱节
深度伪造研究忽视AIG-NCII的主体尊严伤害,需转向受害者中心防护。
ProbSPARQL:查询含多维不确定数值数据的知识图谱
ProbSPARQL扩展SPARQL以支持多维不确定数值数据的分布感知查询与连接,性能可行。
面向小型语言模型算术微调的结构化合成推理数据
利用结构化合成推理数据微调小型语言模型,算术推理准确率显著提升,推理更短且错误更少。
深度强化学习掌握巴格恰尔棋的非对称策略
四种深度强化学习方法应用于Baghchal,MuZero最优(老虎胜率86%,山羊胜率62%),PPO成本低且具竞争力。
使用大语言模型实现时间序列的可解释、数据驱动洞察生成
提出领域无关框架,基于事实生成时间序列预测解释,评估接近分析师水平。
部分可观测性下时序知识图谱记忆的神经符号元策略
提出神经符号元策略,学习符号记忆启发式,结合RDF时序图记忆,实现部分可观测RL最佳性能与可追溯性。
AI智能体中的操作性幻觉与安全漂移
研究揭示AI智能体安全漂移与操作性幻觉现象,提出动作感知监督层架构,可拦截违规而无误报。
AlayaWorld:交互式长程世界建模——完整技术报告
AlayaWorld是15B参数交互式长程视频模型,自回归生成+蒸馏加速至4步,在iWorld-Bench达最优性能。
AgentDebugX:面向LLM代理的故障可观测性、归因与恢复的开源工具包
AgentDebugX开源调试框架实现故障检测、归因与恢复闭环,DeepDebug在多基准上取得最佳归因准确率并显著提升任务修复率。
SciHazard:基于分解有害评分的科学安全风险测量基准
提出科学安全风险基准SciHazard与分解有害评分,专家验证一致性提升90.17%,揭示自主代理安全漏洞。
语义原语作为大语言模型中情绪的解释项
NSM原语可恢复且比评价维度更强更选控情绪,作为模型情绪解释项更优。
DWM:在潜在世界模型中分离世界效应与动作
DWM提出分解式世界模型,将潜在状态变化拆分为动作不变和动作驱动两部分,基准测试平均规划成功率提升13.1%。
一次重写就能修复所有问题?面向文本到图像提示优化的类型感知修复分配
提出TARA框架,类型感知修复分配,分离诊断编译,通过语义门防回归,性能最佳且速度快。
AI原生生物科技需要部门吗?为AI驱动药物开发的公司世界模型进行基准测试
AI原生公司应基于资产到价值的状态模型,而非模仿人类组织;基准测试显示该架构更优。
NaviAIS:场景级船舶轨迹预测数据集——含矢量化航道先验与NaviLane预测框架
提出标准化场景级AIS数据集NaviAIS及层次化宏动作框架NaviLane,融合矢量化航道先验与后果评估,实现多模态轨迹预测。
从依存到组合:基于组合范畴语法的LLM输出神经符号提升
通过CCG将LLM输出提升为类型化组合推导,实现结构检查与外部知识核查,早期识别幻觉内容。
AI旅行会议:基于LLM代理的团体旅行规划
提出多LLM代理框架,模拟不同角色通过自然语言讨论协作规划团体行程。
在信息缺失下评估医学AI:同提供者评估者与人类评分者改变表面安全性
信息缺失时,医学AI安全评估受评估者选择影响:LLM较人类临床医生更宽松,同源评估者偏差显著。
OntoBook:基于本体的合成教科书用于医学编码器预训练
OntoBook通过本体随机游走和LLM生成教科书预训练编码器,显著提升医学编码性能,并强调目标对齐的必要性。
通用智能所需:跨描述层次的不可还原约束
通用智能需跨层次不可约约束,非单架构或规模扩展能实现,研究须对标完整约束谱。
Athena-Brain技术报告:面向通用智能与具身交互的高效机器人大脑
提出Athena-Brain-8B,经多阶段训练保持通用能力并获具身交互,优于同类及较大模型。
参数化动作强化学习中多智能体演员-评论家算法的比较研究
三种多智能体算法对比:共享经验提升GAC性能,超5个智能体后计算成本剧增,性能提升有限。
剔除搭便车者:基于Shapley的并行推理强化学习奖励分配
提出Parallel Shapley框架,用Shapley值区分路径贡献,剔除冗余路径,提升多路径推理训练稳定性。
质量动作保证:VR OSCEs中考官主张的多模态验证
提出QAA多模态框架验证VR OSCEs中考官主张,检测错误精度70%、召回76.7%,事实正确性从39.2%提升至79.2%。
图组合优化中预训练的有效性研究
通过自监督图对比学习和几何增广(旋转、反射),预训练框架显著提升TSP求解性能,混合策略改进了6.57%。
超认知模式:一种用于智能体记忆的路由架构
提出SCM架构,将查询路由到不同检索合成模式,在三个基准测试中表现良好,但因果效应未验证。
OpenRTAG:数据质量退化下文本属性图学习鲁棒性的综合基准
OpenRTAG基准系统评估文本属性图在数据质量退化下的鲁棒性,涵盖九种退化场景与多种模型。
ResearchArena:评估自动化AI研发中的破坏与监控
ResearchArena框架评估AI研发中的破坏与监控,发现训练数据隐藏破坏最难捕获,监控器运行实验仍不足。
CODENS:将代码变更转化为生动、可访问且可查询的文档
CODENS将拉取请求转化为软件知识图谱,支持多模式检索与仓库级问答,保留变更历史,评估显示答案质量高但摘要需更简洁。
本地电力市场中产消者的市场策略评估
基于代理仿真评估四种策略:规则资源控制降成本37.4%,市场自适应策略夏季增收40.1%,效果受组合与季节影响。
警察与强盗问题的领域设计
将图是否为k-copwin转化为非确定性规划问题,用规划器求解并扩展变体。
辨别微积分:与决策相关的洞察、序列价值及作为高阶学习的遗忘
生成式AI洞察泛滥,APOHA理论以价值感知遗忘降低决策遗憾24-32%,保持小而洁的记忆。
用图神经网络近似系统发育树之间的SPR距离
研究用GNN近似SPR距离,训练后快速比较,解释87-90%方差,但外推至大树精度下降。
PRISM:面向高效神经网络加密的敏感性感知多项式剪枝
提出PSAP剪枝方法,联合优化权重、激活敏感性与旋转代价,在加密网络中大幅降低灾难性层数量,提升可靠性同时减少计算开销。
分布优先的人口模拟:非WEIRD LLM人物建模中的崩溃、校准与召回
独立LLM代理导致人群响应分布崩溃,分布优先法(VS)可校正但过度分散,提出一次性分布建模与预算路由器。
FSDBN: 通过动态脑网络实现前景感知的脑电-视觉对齐
FSDBN用动态脑网络和前景对齐实现脑电视觉解码,零样本检索top-1达69%。
利用扩散生成模型应对听觉注意解码中的数据不足问题
扩散模型合成EEG数据增强训练集,显著提升助听器听觉注意解码性能,缓解数据稀缺问题。
解码时文法:基于文法片段精化序的约束LLM生成
提出解码时文法,利用运行时环境动态约束LLM生成,消除未定义符号引用,保证语法语义正确且开销适中。