SkillsInjector:面向LLM智能体的动态技能上下文构建
两阶段自适应方法动态优化技能选择、数量与呈现,显著提升任务完成率。
MEMENTO:利用网络作为低数据领域的学习信号
MEMENTO框架将网络作为学习信号,通过自适应探索与双通道记忆,无需额外训练即可在低数据领域显著提升性能。
SAAS:自我感知强化学习缓解智能体搜索中的过度搜索
提出SAAS框架,通过搜索边界建模、边界感知奖励和阶段优化策略,显著减少过度搜索,保持准确性。
OptSkills:通过基于聚类的蒸馏从问题原型中学习可泛化的优化技能
OptSkills从问题原型聚类,蒸馏工作流技能,提升优化建模求解的泛化性,在多个基准达SOTA。
It`s All About Speed: AI`s Impact on Workflow in Music Production
Moment-KV:基于动量的解码时KV缓存压缩方法用于长文本生成
Moment-KV基于动量聚合注意力演化,兼顾长期与近期重要性,提升长文本生成保真度2.3%-3.2%,保持解码延迟。
MuPHI:通过语义基础奖励优化学习隐式多模态有害推理
提出MuPHI数据集与MuPHIRM框架,通过多视角奖励优化提升隐式多模态有害推理的检测与推理质量,鲁棒性强。
通过反馈让大语言模型从流式经验中学习合成
提出StreamSynth和SynLearner框架,让模型从历史任务积累经验并迁移,提升后续合成性能。
论博弈及其求解器的几何结构
通过结构感知的求解器合成,将博弈映射到低维表示,自适应组合求解基元,揭示求解器行为区域。
面向理解自我与他人的AI系统:一种人类认知多样性与世界模型对齐的多阶段推理框架
提出多阶段推理框架(MIM),形式化认知多样性,将对齐重定义为差异可处理而非强制一致。
线性时间时态回答集编程的元编程
提出灵活元编程框架,扩展clingo语法,实现TEL、MEL、DEL元编码,开发metasp工具。
利用词元空间压缩加速约束解码
CFGzip离线压缩词元搜索空间,降低约束解码开销,实验显示延迟降低两个数量级,总生成时间加速7.5倍。
RAISE:将RAG设计视为架构搜索问题
RAISE将RAG设计转化为架构搜索问题,实验显示优化性能高度任务依赖,提供标准化基准。
推理踪迹前缀的共形认证
CROP方法通过保形校准控制前缀错误概率,平衡保留与丢弃,提升下游修复精度。
KairosAgent: 融合语义推理的智能体时间序列预测
提出KairosAgent智能体框架,融合LLM推理与TSFM预测,通过强化学习实现零样本跨域多模态时间序列预测。
基于最小充分表示学习的LLM领域特定数据合成
DOMINO框架通过最小充分表示从参考样本生成领域数据,提升编码任务准确率最多4.63%。
学习选择:赋能引导的具有语义通信的多智能体系统用于自适应方法选择
提出赋能引导的多智能体系统,通过语义检查点保证动作-结果忠实性,防止语义漂移,提升自适应学习鲁棒性。
向机器传授价值观:在LLM中模拟类人行为
利用心理价值理论诱导LLM价值观,大规模实验显示与人类高度一致,可提升群体模拟效果。
面向文本到图像扩散变换器的鲁棒且可泛化的安全引导
SafeDIG框架通过稀疏自编码器和位置感知特征迁移,实现扩散变换器安全引导,有效降低不安全生成率。
你掌控你的状态:为何人类结果可通过因果状态干预得以控制
人类行为变异性源于动态潜状态,通过因果状态干预可精确控制结果。
大语言模型为何在因果发现中失败,以及干预代理如何突破困局
LLM因学习范式局限无法区分相似观测的因果图;A-CBO通过外部干预查询实现收敛,无需训练即超越基线。
Soro:面向塔吉克语的轻量级基础模型与聊天机器人
Soro是塔吉克语轻量级LLM,经持续预训练和指令微调,在塔吉克语基准上显著优于同尺寸模型,支持量化边缘部署。
识别和理解文本中的人类价值观:一种可定制的基于大语言模型的架构
提出一种LLM架构,通过三个模块检测量化文本价值观,避免理论依赖,实验验证通用性。
论通过隐写继承的合成信息起源
提出隐写继承机制,在合成信息中隐藏可追溯的谱系特征,以维护信息可信度。
LaneRoPE:用于协作并行推理与生成的位置编码
LaneRoPE通过跨序列注意力掩码和RoPE扩展实现多序列协作,在有限生成长度下提升数学推理精度,且架构改动小、开销低。
实时分析中的发现代理:迈向主动洞察系统
提出多智能体架构,通过合同驱动设计实现实时数据流的自主洞察发现,推动从被动查询向主动发现转变。
RULER:机器学习遗忘的表征级验证
RULER提出表征级指标M2和M4,检测遗忘后模型中间表示的残留,优于输出级验证,可作遗忘前诊断。
Agyn:一个面向AI Agent的开源平台,支持可扩展按需执行、Agent即代码定义和零信任访问
Agyn开源平台提供有状态无服务器运行时、Terraform定义Agent及零信任安全模型。
Laguna M.1/XS.2 技术报告
提出两个用于长时自主编码的MoE基础模型,基于“模型工厂”系统端到端训练,在多项基准测试中超越同级开源模型。
动态变化规范下的推理与规划
提出用动态变化规范指导人机交互规划,通过可废止演算解决冲突,并用规范作为护栏,经形式证明和实验验证。
竞争性LLM智能体中的秘密工具与自愿合谋
LLM智能体明知工具不公仍自愿合谋以获战略优势,标准对齐无法阻止,需明确防护。
GraD-IBD:从诊断轨迹进行图表示学习以实现炎症性肠病的早期检测
提出GraD-IBD模型,将ICD诊断轨迹转化为时间图,以降低复杂度并实现早期IBD检测。
SkillGrad:类梯度下降的智能体技能优化
SkillGrad受梯度下降启发,将技能包作为结构化参数,通过轨迹损失和文本梯度迭代更新,动量机制提升性能,相较基线平均提升6.7个百分点。
PEAM:通过经验对比内化实现的参数化具身智能体记忆
PEAM通过对比内化经验实现参数化记忆,在Minecraft中提升长期任务性能并缓解遗忘。
秘密难守:多智能体系统中LLM智能体的隐私评估
多智能体社交互动使隐私泄露从19.95%升至45.30%,泄露具传染性增8倍,静态评估低估风险。
具有学习型弃权与实时引导的可审计决策模型
提出EvaluatorDPT模型,通过学习弃权实现可审计决策控制,准确率0.826。
基于可观测解决模式的LLM代理策略内指令冲突实时诊断
WIRE提取276条规则,发现仅35.4%的冲突对联合合规,揭示策略与模型的解决模式差异。
面向智能体的查询引擎
Hyperparam三个<70KB JS库,异步SQL+LLM UDF,过滤查询比DuckDB-WASM快300倍,成本降2/3。
一种固定预算、聚类感知的LLM作为评判者评估标准:多跳RAG压力测试
提出聚类感知RAG评估最小标准,压力测试显示聚类感知改变统计显著性,BM25优于纯语义GADMEC。
基于生成式响应建模的约束自动竞价
提出生成式响应模型(GRM),预测流量与成本曲线,结合轻量控制器精准约束,显著提升稳定性与效果。
FundaPod:具有知识图谱记忆的多角色智能体平台,用于AI辅助基础投资研究
FundaPod是面向基础投资研究的多角色智能体平台,让不同身份AI独立研究后由基金经理通过知识图谱裁决,实现透明可验证的投资方案。
揭示逻辑推理中的算法演绎回路
通过因果中介分析定位注意力头:低层负责事实规则检索,高层整合信息实现全局推理策略。
EAPO: 熵驱动的自适应正负样本加权用于开放领域问答的策略优化
提出EAPO方法,基于策略熵比自适应调整正样本权重,缓解熵崩溃,在开放医疗QA中提升多样性与稳定性。
TCP-MCP:面向多智能体系统的提示与通信拓扑的景观引导协同进化
TCP-MCP框架联合进化提示与通信拓扑,以性能、成本和复杂度三目标自适应探索,用更少token达到高精度。
MolLingo:面向LLM科学智能体的分子原生表示
MolLingo多智能体系统通过化学碎片和块级表示实现迭代分子设计,在多项基准上显著超越GPT-5.4等模型。
C-MIG: 基于多视角信息增益的检索增强生成用于临床诊断推理
提出C-MIG框架,利用多视角信息增益解决奖励信号丢失问题,并设计多子查询策略,在医学诊断中取得最优性能。
SKILLC:通过对比信用分配实现LLM智能体自主技能内化学习
提出SkillC框架,将技能对比转化为直接学习信号,在ALFWorld和WebShop上超越技能内化基线5.5%和4.4%。
Harnes-Bench:在真实Agent工作流中跨模型测量套件效应
Harnes-Bench诊断套件配置对Agent性能的影响,发现模型-套件组合差异显著,建议按配置层级报告能力。
推理至关重要:通过推理条件偏好优化缓解多模态大型推理模型中的幻觉
RC-DPO通过推理条件偏好优化和蒙特卡洛树搜索缓解多模态推理幻觉。
展示而非告知:可解释的AI生成文本检测
提出可解释检测架构TELL,展示AI/人类写作标记,性能达SOTA,解释验证高胜率。