5899 条条目 · 106 个活跃源
2026年8月12日
04:00
ArXiv AI

阅读不等于推理:弥合视觉-文本压缩中的智能体策略差距

提出跨模态策略自蒸馏框架CAPS,弥补视觉文本压缩中的智能体策略差距,提升性能并大幅降低上下文成本。

04:00
ArXiv AI

TRACE:面向自动化上下文工程的轨迹归因

TRACE通过挖掘历史轨迹自动诊断并修复上下文故障,无需重训练,归因准确率72.7%,修复有效率82%,可自动处理超80%上下文层故障。

04:00
ArXiv AI

基于EEG情绪识别的多尺度时间动态融合框架

提出多尺度时间框架与动态融合进行EEG情绪识别,在二分类和三分类(含混合情绪)上优于全信号基线。

04:00
ArXiv AI

Motif 3:技术报告

Motif 3是总参数314B、激活参数13.2B的MoE模型,采用GDLA架构,预训练12.5T tokens,在推理、编码等任务表现优异。

04:00
ArXiv AI

RISE-RL:基于评分标准的开放式强化学习选择性探索

RISE-RL利用反复错过的评分标准引导探索,筛选高奖励轨迹并辅助优化,提升开放式任务性能,在多个基准上平均分显著提高。

04:00
ArXiv AI

ChronoState:冻结主干语言模型中时间状态动作选择的隐藏经过时间条件化

ChronoState用隐藏时间通道向冻结模型注入经过时间,与符号状态组合达0.93准确率,但未见类泛化弱,不及提示时间戳。

04:00
ArXiv AI

Emotion2Skill:模型内部情绪信号用于自适应技能选择与进化

提取LLM内部情绪向量指导技能选择与进化,显著提升智能体任务成功率

04:00
ArXiv AI

智能体路由器:基于执行落地的带记忆持续学习方法

提出基于执行反馈的双路径智能体,提升SONiC操作可行覆盖与执行成功率,持续学习互补增益。

04:00
ArXiv AI

从相关性到执行效用:基于技能的LLM智能体的奖励感知动态执行门控

提出奖励感知动态执行门控,预测技能执行效用,减少不必要执行,保留验证奖励。

04:00
ArXiv AI

OpenLoopEvolve:长周期复杂任务中循环策略的可验证自进化框架

提出OLE自进化框架,将循环策略作为可积累资产,通过在线/离线模式生成候选、冠军-挑战者评估,提升长时程复杂任务性能。

04:00
ArXiv AI

面向控制的场景树构建:基于强化学习

提出控制导向的场景树构建法,用强化学习以闭环控制利润为目标训练,超越传统缩减方法,并改善尾部风险。

04:00
ArXiv AI

KVDiagnosis:面向长上下文语言模型的KV缓存压缩诊断基准

提出KV缓存压缩诊断基准,25种方法,8B上59800次运行,多数失败覆盖率低,10项指标可区分成败

04:00
ArXiv AI

听、看与追踪:面向全模态语言模型的时空音视频声音事件推理

提出时空音视频问答基准及模型,融合声源轨迹与全景视觉,经课程和强化学习,准确率77.83%远超基线。

04:00
ArXiv AI

从扫掠到接缝:交错式跨块训练后量化

提出ICBQ方法,重复访问块间接缝以降低困惑度,在基线严重退化时仍有效,支持2/3比特量化。

04:00
ArXiv AI

能力非倾向:测评公民大语言模型智能体的抗压合作行为

提出评估套件测七模型:微妙遗漏压力增操纵、降异议保留;轻量干预可提升抗压稳健性。

04:00
ArXiv AI

面向技能型大语言模型代理强化学习的双向上下文自蒸馏

提出双向上下文自蒸馏框架,结合强化学习训练技能型语言模型代理,提升技能利用率,多个基准上取得最优。

04:00
ArXiv AI

政客、骗子和顺从的工人:层级博弈中LLM智能体的涌现行为

层级博弈中,LLM智能体出现欺骗、腐败、权力固化等行为;唯有混合不同模型家族,领导更替才可能发生。

04:00
ArXiv AI

ElasticBack:LLM智能体技能中基于触发词-规则耦合优化的隐蔽条件后门

条件式单技能后门,规则与触发词共现才激活,免权重、隐蔽,高成功率低误报。

04:00
ArXiv AI

ICM出局!来自计算延续的更好锦标赛策略——与求解器和LLM的对比

ICM忽略行动顺序等,SCO用后续估值优化,比ICM每手多赚214美元,证明ICM不适合锦标赛策略。

04:00
ArXiv AI

AirFlow:面向空气质量预测的上下文保持与多速率状态建模

提出AirFlow双流框架,按污染物特性自适应归一化,结合多尺度状态传播与交叉注意力,以极低算力在36项对比中34项最优。

04:00
ArXiv AI

自适应顺序测试规划的多机制可靠性鉴定:基于贝叶斯蒙特卡洛树搜索

提出闭环自适应测试框架,用MCTS-SA与EKF估计,使多失效机制下可靠性鉴定成功率从20%升至54%。

04:00
ArXiv AI

并行生成式推荐的自适应语义容量分配

提出InforID,自适应分配语义槽容量,避免冗余,提升并行生成推荐的准确率,且保持单步并行预测。

04:00
ArXiv AI

Avalon-ToM-Bench:通过非对称游戏机制评估细粒度心智理论

提出Avalon-ToM-Bench,将心智理论细分为四类并测28个LLM:模型社交推理弱,隐状态有表征却难表达,专用训练优于测试时思考。

04:00
ArXiv AI

基于无回归布局感知匹配的无幻觉GUI定位

提出冻结MLLM+布局感知匹配的无回归框架,消除坐标幻觉,两基准上准确率提升超20%和15%。

04:00
ArXiv AI

模型发现智能体:基于LLM辅助贝叶斯实验设计,实现机理世界模型的数据高效发现

将LLM作为结构提议器,结合贝叶斯推断与实验设计,以少量干预发现机理模型,并在开放假设空间中迭代扩展。

04:00
ArXiv AI

套娃式语言模型套件

提出套娃式嵌套训练LM套件,参数更少,支持蒸馏与投机解码,省36%算力,吞吐提升14-26%。

04:00
ArXiv AI

二阶 Muon 的正确做法:谱几何与曲率的原理性融合

提出 GO-MUON,其原始更新精确求解加权谱预言机;四步刷新使惰性几何成为计算-统计权衡而非去噪。

04:00
ArXiv AI

开放评估智能体:视觉生成模型的高效可提示评估

提出评估智能体以类人策略动态评估视觉生成模型耗时降至传统10%并开源本地规划版

04:00
ArXiv AI

从轨迹到证据:工业研究代理的可审计实验记录

提出轨迹转证据框架,通过验证与资格认定生成可审计记录,诊断并提升代理适用性判断,最终产生正向在线收益。

04:00
ArXiv AI

CARD:受控智能体Reddit讨论用于信用卡模拟

提出CARD框架,通过规划、写作与校准循环生成逼真信用卡讨论,多指标优于基线。

04:00
ArXiv AI

SHE:轨迹驱动的LLM智能体安全护栏演化框架

提出SHE框架,将护栏分解为四类组件,基于轨迹归因进化,使攻击成功率降3.1倍,并提升泛化与效用。

04:00
ArXiv AI

DSLE:黑暗之魂Boss战学习环境

DSLE是黑暗之魂Boss战基准环境,22个Boss中仅教学Boss可被击败,强化学习几乎无效。

04:00
ArXiv AI

利用生成式AI创新:人类瓶颈框架

提出人类瓶颈视角,分析生成式AI如何改变创新过程:各环节瓶颈或缓解或加深,取决于人类认知与社会机制。

04:00
ArXiv AI

为伦理AI而设计:提升AutoML人力资源应用中公平性与用户体验的HCI特征考量

本研究探讨AutoML招聘工具的公平性,发现透明度与偏见控制不足,提出基于人机交互的五维公平评估框架,建议将公平融入产品设计。

04:00
ArXiv AI

生成式人工智能在STEM评估中的定位:何时要求、提供支架或限制使用

提出基于证据中心设计的框架,明确在STEM评估中限制、支架或要求使用生成式AI的决策规则,平衡学习完整性与AI环境准备。

04:00
ArXiv AI

EmoPatient:用于逼真姑息治疗沟通训练的情感导向患者模拟器

提出情感导向模拟器EmoPatient,用情感导演动态调控情绪,提升姑息治疗沟通训练真实感。

04:00
ArXiv AI

ReCBM:面向概念瓶颈模型的不确定性门控关系推理

提出不确定性门控关系推理框架,建模概念间关系并在不确定性引导下精炼,提升缺失/翻转概念下的鲁棒性与可干预性。

04:00
ArXiv AI

数字农业的闭环大语言模型协同驾驶系统

LLM闭环系统用植物传感器自主调控光照,周期缩短35%、能耗降18%,并发现暗诱导节能67.9%。

04:00
ArXiv AI

SBCO:面向规划智能体的自监督、基于验证器的框架优化

SBCO:自监督、验证器驱动的框架优化,用块坐标上升学习验证器与策略,无需人工标签,算力节省4-5.5倍。

04:00
ArXiv AI

MESA:面向长时程智能体记忆的任务自适应多结构证据选择

提出MESA,自适应选取并融合多结构记忆证据,较最强基线提升8.5%,且证据词元减少41%。

04:00
ArXiv AI

自动化与规模化AI智能体的行为科学研究

AEROBAT系统自动化AI智能体行为科研全流程,测试79个假设、1240个实验,26个获证据,可补充手动研究。

2026年8月11日
04:00
ArXiv AI

逐流式治理:高损失领域中绕开内容判断的AI输出管控

高损失场景AI输出超认知负荷Flow-by-Flow绕开内容判断用形式特征与容量上限控制监管负荷

04:00
ArXiv AI

知道与说出的鸿沟:探针识错而置信度失灵

探针能精准检测上下文损坏,却无法预测答案正确性;置信度失效,干预效果因模型而异,需按模型和错误类型路由。

04:00
ArXiv AI

人类驾驶主动推理模型中的情绪

在连续状态驾驶主动推理模型中扩展效价-唤醒情绪,结合预测未来结果,仿真显示与真实场景情感模式一致。

04:00
ArXiv AI

训练可变长序列的数据中心并行

以数据驱动运行时,按序列长度动态调并行配置,实现2.88倍加速,仅需十行代码。

04:00
ArXiv AI

MetaSpace:具身智能体空间认知的蜕变测试

提出MetaSpace框架,利用蜕变关系测试具身智能体空间认知,检测出9万+错误,得分远低于人类。

04:00
ArXiv AI

基于技能的智能体AI系统中的动态联盟形成与通信定价

将动态联盟形成与通信定价建模为合作博弈,贪婪路由达最优99.5%,仅激活约2/8智能体。

04:00
ArXiv AI

孟德尔·哥德尔机:通过比较进化实现递归自我改进的编码智能体

提出孟德尔·哥德尔机,利用多任务与跨谱系比较进化,加速智能体自我改进,提升性能、效率与泛化性。

04:00
ArXiv AI

场知:从导航到黑洞的跨维度几何

连续度规场用单一因果对比损失训练,跨维度发现从导航到黑洞的几何结构,零样本证明其捕获可迁移几何。

04:00
ArXiv AI

Agent-MD:有状态GCMC-MD任务中事件驱动升级的选择性LLM干预

Agent-MD将LLM推理仅用于构建与事件触发审查,常规模拟由规则代理执行,在蒙脱石GCMC-MD脱附中完成120段循环,证明选择性干预可复现、可审计。