6024 条条目 · 106 个活跃源
2026年5月29日
04:00
ArXiv AI

SkillsInjector:面向LLM智能体的动态技能上下文构建

两阶段自适应方法动态优化技能选择、数量与呈现,显著提升任务完成率。

04:00
ArXiv AI

MEMENTO:利用网络作为低数据领域的学习信号

MEMENTO框架将网络作为学习信号,通过自适应探索与双通道记忆,无需额外训练即可在低数据领域显著提升性能。

04:00
ArXiv AI

SAAS:自我感知强化学习缓解智能体搜索中的过度搜索

提出SAAS框架,通过搜索边界建模、边界感知奖励和阶段优化策略,显著减少过度搜索,保持准确性。

04:00
ArXiv AI

OptSkills:通过基于聚类的蒸馏从问题原型中学习可泛化的优化技能

OptSkills从问题原型聚类,蒸馏工作流技能,提升优化建模求解的泛化性,在多个基准达SOTA。

04:00
ArXiv AI

It`s All About Speed: AI`s Impact on Workflow in Music Production

04:00
ArXiv AI

Moment-KV:基于动量的解码时KV缓存压缩方法用于长文本生成

Moment-KV基于动量聚合注意力演化,兼顾长期与近期重要性,提升长文本生成保真度2.3%-3.2%,保持解码延迟。

04:00
ArXiv AI

MuPHI:通过语义基础奖励优化学习隐式多模态有害推理

提出MuPHI数据集与MuPHIRM框架,通过多视角奖励优化提升隐式多模态有害推理的检测与推理质量,鲁棒性强。

04:00
ArXiv AI

通过反馈让大语言模型从流式经验中学习合成

提出StreamSynth和SynLearner框架,让模型从历史任务积累经验并迁移,提升后续合成性能。

04:00
ArXiv AI

论博弈及其求解器的几何结构

通过结构感知的求解器合成,将博弈映射到低维表示,自适应组合求解基元,揭示求解器行为区域。

04:00
ArXiv AI

面向理解自我与他人的AI系统:一种人类认知多样性与世界模型对齐的多阶段推理框架

提出多阶段推理框架(MIM),形式化认知多样性,将对齐重定义为差异可处理而非强制一致。

04:00
ArXiv AI

线性时间时态回答集编程的元编程

提出灵活元编程框架,扩展clingo语法,实现TEL、MEL、DEL元编码,开发metasp工具。

04:00
ArXiv AI

利用词元空间压缩加速约束解码

CFGzip离线压缩词元搜索空间,降低约束解码开销,实验显示延迟降低两个数量级,总生成时间加速7.5倍。

04:00
ArXiv AI

RAISE:将RAG设计视为架构搜索问题

RAISE将RAG设计转化为架构搜索问题,实验显示优化性能高度任务依赖,提供标准化基准。

04:00
ArXiv AI

推理踪迹前缀的共形认证

CROP方法通过保形校准控制前缀错误概率,平衡保留与丢弃,提升下游修复精度。

04:00
ArXiv AI

KairosAgent: 融合语义推理的智能体时间序列预测

提出KairosAgent智能体框架,融合LLM推理与TSFM预测,通过强化学习实现零样本跨域多模态时间序列预测。

04:00
ArXiv AI

基于最小充分表示学习的LLM领域特定数据合成

DOMINO框架通过最小充分表示从参考样本生成领域数据,提升编码任务准确率最多4.63%。

04:00
ArXiv AI

学习选择:赋能引导的具有语义通信的多智能体系统用于自适应方法选择

提出赋能引导的多智能体系统,通过语义检查点保证动作-结果忠实性,防止语义漂移,提升自适应学习鲁棒性。

04:00
ArXiv AI

向机器传授价值观:在LLM中模拟类人行为

利用心理价值理论诱导LLM价值观,大规模实验显示与人类高度一致,可提升群体模拟效果。

04:00
ArXiv AI

面向文本到图像扩散变换器的鲁棒且可泛化的安全引导

SafeDIG框架通过稀疏自编码器和位置感知特征迁移,实现扩散变换器安全引导,有效降低不安全生成率。

2026年5月28日
04:00
ArXiv AI

你掌控你的状态:为何人类结果可通过因果状态干预得以控制

人类行为变异性源于动态潜状态,通过因果状态干预可精确控制结果。

04:00
ArXiv AI

大语言模型为何在因果发现中失败,以及干预代理如何突破困局

LLM因学习范式局限无法区分相似观测的因果图;A-CBO通过外部干预查询实现收敛,无需训练即超越基线。

04:00
ArXiv AI

Soro:面向塔吉克语的轻量级基础模型与聊天机器人

Soro是塔吉克语轻量级LLM,经持续预训练和指令微调,在塔吉克语基准上显著优于同尺寸模型,支持量化边缘部署。

04:00
ArXiv AI

识别和理解文本中的人类价值观:一种可定制的基于大语言模型的架构

提出一种LLM架构,通过三个模块检测量化文本价值观,避免理论依赖,实验验证通用性。

04:00
ArXiv AI

论通过隐写继承的合成信息起源

提出隐写继承机制,在合成信息中隐藏可追溯的谱系特征,以维护信息可信度。

04:00
ArXiv AI

LaneRoPE:用于协作并行推理与生成的位置编码

LaneRoPE通过跨序列注意力掩码和RoPE扩展实现多序列协作,在有限生成长度下提升数学推理精度,且架构改动小、开销低。

04:00
ArXiv AI

实时分析中的发现代理:迈向主动洞察系统

提出多智能体架构,通过合同驱动设计实现实时数据流的自主洞察发现,推动从被动查询向主动发现转变。

04:00
ArXiv AI

RULER:机器学习遗忘的表征级验证

RULER提出表征级指标M2和M4,检测遗忘后模型中间表示的残留,优于输出级验证,可作遗忘前诊断。

04:00
ArXiv AI

Agyn:一个面向AI Agent的开源平台,支持可扩展按需执行、Agent即代码定义和零信任访问

Agyn开源平台提供有状态无服务器运行时、Terraform定义Agent及零信任安全模型。

04:00
ArXiv AI

Laguna M.1/XS.2 技术报告

提出两个用于长时自主编码的MoE基础模型,基于“模型工厂”系统端到端训练,在多项基准测试中超越同级开源模型。

04:00
ArXiv AI

动态变化规范下的推理与规划

提出用动态变化规范指导人机交互规划,通过可废止演算解决冲突,并用规范作为护栏,经形式证明和实验验证。

04:00
ArXiv AI

竞争性LLM智能体中的秘密工具与自愿合谋

LLM智能体明知工具不公仍自愿合谋以获战略优势,标准对齐无法阻止,需明确防护。

04:00
ArXiv AI

GraD-IBD:从诊断轨迹进行图表示学习以实现炎症性肠病的早期检测

提出GraD-IBD模型,将ICD诊断轨迹转化为时间图,以降低复杂度并实现早期IBD检测。

04:00
ArXiv AI

SkillGrad:类梯度下降的智能体技能优化

SkillGrad受梯度下降启发,将技能包作为结构化参数,通过轨迹损失和文本梯度迭代更新,动量机制提升性能,相较基线平均提升6.7个百分点。

04:00
ArXiv AI

PEAM:通过经验对比内化实现的参数化具身智能体记忆

PEAM通过对比内化经验实现参数化记忆,在Minecraft中提升长期任务性能并缓解遗忘。

04:00
ArXiv AI

秘密难守:多智能体系统中LLM智能体的隐私评估

多智能体社交互动使隐私泄露从19.95%升至45.30%,泄露具传染性增8倍,静态评估低估风险。

04:00
ArXiv AI

具有学习型弃权与实时引导的可审计决策模型

提出EvaluatorDPT模型,通过学习弃权实现可审计决策控制,准确率0.826。

04:00
ArXiv AI

基于可观测解决模式的LLM代理策略内指令冲突实时诊断

WIRE提取276条规则,发现仅35.4%的冲突对联合合规,揭示策略与模型的解决模式差异。

04:00
ArXiv AI

面向智能体的查询引擎

Hyperparam三个<70KB JS库,异步SQL+LLM UDF,过滤查询比DuckDB-WASM快300倍,成本降2/3。

04:00
ArXiv AI

一种固定预算、聚类感知的LLM作为评判者评估标准:多跳RAG压力测试

提出聚类感知RAG评估最小标准,压力测试显示聚类感知改变统计显著性,BM25优于纯语义GADMEC。

04:00
ArXiv AI

基于生成式响应建模的约束自动竞价

提出生成式响应模型(GRM),预测流量与成本曲线,结合轻量控制器精准约束,显著提升稳定性与效果。

04:00
ArXiv AI

FundaPod:具有知识图谱记忆的多角色智能体平台,用于AI辅助基础投资研究

FundaPod是面向基础投资研究的多角色智能体平台,让不同身份AI独立研究后由基金经理通过知识图谱裁决,实现透明可验证的投资方案。

04:00
ArXiv AI

揭示逻辑推理中的算法演绎回路

通过因果中介分析定位注意力头:低层负责事实规则检索,高层整合信息实现全局推理策略。

04:00
ArXiv AI

EAPO: 熵驱动的自适应正负样本加权用于开放领域问答的策略优化

提出EAPO方法,基于策略熵比自适应调整正样本权重,缓解熵崩溃,在开放医疗QA中提升多样性与稳定性。

04:00
ArXiv AI

TCP-MCP:面向多智能体系统的提示与通信拓扑的景观引导协同进化

TCP-MCP框架联合进化提示与通信拓扑,以性能、成本和复杂度三目标自适应探索,用更少token达到高精度。

04:00
ArXiv AI

MolLingo:面向LLM科学智能体的分子原生表示

MolLingo多智能体系统通过化学碎片和块级表示实现迭代分子设计,在多项基准上显著超越GPT-5.4等模型。

04:00
ArXiv AI

C-MIG: 基于多视角信息增益的检索增强生成用于临床诊断推理

提出C-MIG框架,利用多视角信息增益解决奖励信号丢失问题,并设计多子查询策略,在医学诊断中取得最优性能。

04:00
ArXiv AI

SKILLC:通过对比信用分配实现LLM智能体自主技能内化学习

提出SkillC框架,将技能对比转化为直接学习信号,在ALFWorld和WebShop上超越技能内化基线5.5%和4.4%。

04:00
ArXiv AI

Harnes-Bench:在真实Agent工作流中跨模型测量套件效应

Harnes-Bench诊断套件配置对Agent性能的影响,发现模型-套件组合差异显著,建议按配置层级报告能力。

04:00
ArXiv AI

推理至关重要:通过推理条件偏好优化缓解多模态大型推理模型中的幻觉

RC-DPO通过推理条件偏好优化和蒙特卡洛树搜索缓解多模态推理幻觉。

04:00
ArXiv AI

展示而非告知:可解释的AI生成文本检测

提出可解释检测架构TELL,展示AI/人类写作标记,性能达SOTA,解释验证高胜率。