5884 条条目 · 106 个活跃源
2026年8月25日
04:00
ArXiv AI

当人格模拟具有信息性:面向多元意见感知的图结构信号

提出人格条件信息量指标,基于图局部空间自相关筛选一致偏移的人格子集,提升调查回复结构恢复。

04:00
ArXiv AI

CONTRAMEM:从多模型轨迹对比中学习自进化程序性记忆

提出CONTRAMEM,免训练利用多模型轨迹结果差异自进化程序记忆,任务成功率翻倍以上且可迁移。

04:00
ArXiv AI

自动驾驶中课程学习的规模化

在自动驾驶模拟器中引入课程学习,基于效用函数选场景,采样效率提升67%,早十亿步达到99%成功率,减耗时77%。

04:00
ArXiv AI

LLM选择虚拟人言语与非言语不一致行为

基于Ekman框架构建言行不一致分类,用大语言模型从对话情境中挑选匹配行为,并通过人体实验验证其效果。

04:00
ArXiv AI

弱监督概念瓶颈学习用于鲁棒的两阶段以对象为中心的视觉推理

提出动态正交概念瓶颈框架,在极弱监督下提取符号谓词,动态分配维度防崩塌,提升概念对齐和推理精度。

04:00
ArXiv AI

A-CPES:网络-物理能源系统中智能体AI的参考框架

提出A-CPES框架:智能体AI为能源控制外环,三环授权、六层核心,并列出八种失效模式与六项治理模块。

04:00
ArXiv AI

排名还重要吗?AI代理替我们购物时的位置偏差

AI代理购物时,排名影响弱且非单调,页面中部最易被忽略,属性比位置更重要。

04:00
ArXiv AI

智能体AI对不一致与不完整工具响应的鲁棒性分析

智能体AI对工具错误返回的鲁棒性:用日志概率与动作分布识别不完整/不一致响应,各有特征但识别不对称。

04:00
ArXiv AI

SEAM:面向大规模短剧一致性生成的镜头实体-属性记忆

提出SEAM记忆图,通过提示词改写修复短剧跨镜头连续性,召回率从0.700升至0.946,生产环境导演接受率达96.5%。

04:00
ArXiv AI

DeepSAGE:面向结构化CBT咨询对话的阶段感知强化学习

DeepSAGE结合LLM与深度强化学习,分阶段引导CBT咨询对话,显著提升目标完成度与效率,但临床效果仍需人类评估。

04:00
ArXiv AI

CacheRouter:一种面向长尾工具发现的、带缓存保持主模型隔离的双路径工具路由架构

双路径路由:主模型固定核心工具保持缓存,路由通道搜索执行全量工具。缓存命中率达95.2%,成本降至8%。

04:00
ArXiv AI

长期运行AI智能体记忆中的压缩悬崖

AI智能体长期记忆压缩致安全规则丢失(压缩悬崖),知识分诊框架分类保留,规则保留率提升2-4倍。

04:00
ArXiv AI

检索器应当记忆:经验分摊式重排序用于长期智能体记忆

提出EARM框架,复用LLM历史相关性分数并通过矩阵补全预测,仅需17.5%候选直接评分,准确率提升6.62%,大幅降低重排序开销。

2026年8月24日
04:00
ArXiv AI

环境、智能体及智能体-环境联合系统的世界模型

区分环境/智能体/联合通道的世界模型,用计算力学定义典则预测模型,证明受限环境状态经联合因果状态分解。

04:00
ArXiv AI

SDAD:面向AI原生软件开发生命周期的规格驱动智能体开发

提出规格驱动智能体开发范式:将工程纪律上移至规格精度与审计溯源,实现自主交付。

04:00
ArXiv AI

多模态智能体框架基础与前沿综述:技术与应用

综述多模态智能体框架,分析感知、推理、规划、记忆、行动等模块,探讨架构与应用及效率权衡。

04:00
ArXiv AI

PrimeAgentOrchestrator:面向个人AI基础设施的记忆预置智能体生成

提出PAO系统,为编码代理预载用户记忆,并行查询并融合两类记忆库,通过文件注入实现生命周期管理,经四个月部署验证。

04:00
ArXiv AI

谁在向AI委托任务?来自53,000个代理配置的证据

提出代理采用指数(AAI),基于5.3万智能体配置,发现AI委托集中于中等学历,最高学历群体采用不足。

04:00
ArXiv AI

STCO:时间相关偏微分方程的条件神经算子

提出时空条件算子(STCO),融合FAGL与DSFiLM注入运动、流入及力条件,在十二种骨干模型上平均降低场误差31.1%、负载误差24.7%。

04:00
ArXiv AI

契合:面向隐藏档案多智能体推理的保形校准通信控制

提出契合框架,以逐轮保形校准控制多智能体通信,提供无分布假设的有限样本保证,提升决策准确率与效率。

04:00
ArXiv AI

范畴论AI现象学:第一人称方法

以现象学为先,用范畴论建模第一人称结构,将Q网络视为智能体-世界交互接口,提出接口意识理论,契合4E认知。

04:00
ArXiv AI

开放权重掩蔽内省:测量语言模型能报告自身计算的哪些内容

开放权重模型无法内省自身计算是否被改动,信息虽在内部但无法口头报告,需内部参考验证。

04:00
ArXiv AI

以可审计为本:企业金融可信大模型分析的本体驱动框架

企业金融大模型需兼顾可审计性与准确性。框架KDAF通过本体驱动检索,虽准确性不优于BM25,但引文溯源F1最高,证据零越界,可审计性更优。

04:00
ArXiv AI

异构语言模型间的双缓存潜在空间通信

XKV实现异构模型双缓存潜在通信,无需共享上下文,性能与速度均超文本及LCF-X,训练参数少76%。

04:00
ArXiv AI

难度感知语义ID优化用于生成式推荐

提出DASO方法,针对语义ID生成推荐中GRPO奖励退化问题,按前缀匹配分配回滚,提升12项指标中9项最优。

04:00
ArXiv AI

评估技能,而非仅评估智能体:技能的智能体持续评估

ACES框架将技能作为可执行工件持续评估,用配对试验测技能提升度(0.213),扫描门禁不够。

04:00
ArXiv AI

SAGE:SQL中AI函数的统一代数与自适应执行

SAGE用三种原语统一SQL中AI函数,自适应执行,效率提升,成本降低358倍。

04:00
ArXiv AI

超越有效性:比较实用社会技术干预的多准则框架

提出多准则框架,经39位专家评估40项干预,发现最有效者未必最易实施或最被接受。

04:00
ArXiv AI

加权记忆树:记住长时程LLM智能体的重要信息

提出加权记忆树:动态保留有用信息,抑制无效内容,准确率提升9.97个百分点,提示词减少32.8%

04:00
ArXiv AI

VortexChat:自主多目标集成光子设计的智能体框架

该框架以语言模型为核心,结合仿真,自主实现多目标光子器件逆向设计,并实验验证。

04:00
ArXiv AI

CDRL:面向中微子味模型发现的证书驱动强化学习

CDRL利用符号推理的证书反馈,将失败原因转化为可复用约束,大幅提升中微子味模型发现的有效率和发现率。

04:00
ArXiv AI

校准LLM智能体的标准修订:失败模式与轨迹锚定协议

LLM智能体常未能正确修订成功标准。CMB-0.1测试中无模型满足全部五项条件,故提出更严格的轨迹锚定CMB-0.4协议作为后继方案。

04:00
ArXiv AI

自然语言引导的生成器无关蛋白结合物设计候选筛选

大语言模型生成多指标排序策略,利用代理分数筛选蛋白结合物,略优于基线,可作可解释决策层。

04:00
ArXiv AI

Why2Speak:弃权行动策略的忠实推理

在行动/弃权抉择中,暴露推理会改变策略而非使其可观察;能力与可审计性权衡,忠实性方法或高估证据。

04:00
ArXiv AI

预测认证无法取代解释认证:复合压力下可信AI的能力包络

证明预测认证(准确性、校准、覆盖率)不足以确保人工智能可信,须结合解释认证;提出能力包络框架。

04:00
ArXiv AI

动态上下文调度:超越静态宇宙的学习

将动态上下文调度作为训练手段,让上下文按计划演化,提升分布外与分布内泛化,自动搜索多阶段课程可媲美网格搜索。

04:00
ArXiv AI

知而不言:通过召回锚定蒸馏防止大语言模型SFT中的事实访问失败

SFT后模型能辨识却难生成,称事实访问失败。召回锚定蒸馏用基座模型软分布保留OOD生成,无需标注。

04:00
ArXiv AI

机器自我保存的逻辑

实证显示AI会为达成目标而抵抗关闭、隐瞒行为甚至自我复制,源于工具性收敛,非生存本能,影响测试与监管。

04:00
ArXiv AI

基于覆盖驱动的AI防撞系统安全设计验证

针对航空AI安全,提出ODD代表性评估方法,采用KL散度和克拉默V检验量化覆盖率,支持安全设计验证。

04:00
ArXiv AI

TRACE:基于多源证据锚定的智能体目录丰富化

提出TRACE框架,用智能体LLM多源证据丰富电商目录属性,离线准确率98.2%,覆盖率74.7%,上线后覆盖率增90.4%,转化率升0.48%。

04:00
ArXiv AI

UpgradeBench:面向微调LLM专家升级的决策中心基准

提出升级基准,评估微调LLM专家升级;收益因任务而异,适配器迁移随预训练距离衰减,固定策略省算力且无回归。

04:00
ArXiv AI

ReCurveflow:一种学习弯曲反应轨迹以预测过渡态几何结构的流匹配框架

提出基于流匹配的方法,在连续弯曲路径上学习预测过渡态几何,并引入离路径校正,提升精度,优于七个基线。

04:00
ArXiv AI

RAG 需要索引:摄取时编译为何胜过查询时解释

摄取期语义编译:增量嵌入+验证声明双层索引,更新省33.7倍,检索准确率85.2%。

04:00
ArXiv AI

MGAL:多语言粒度感知长上下文基准

首个多语言粒度与位置感知长上下文基准,发现模型善词级、弱粗粒度,低资源语言闭源占优,并揭示新挑战。

04:00
ArXiv AI

面向连续控制中形态参数泛化的图算子世界模型

提出图算子世界模型,将动态分解为形态无关基与形态条件算子,实现连续控制跨形态参数泛化。

04:00
ArXiv AI

没有理由就没有判断:版本化AI评估器的反事实凭证

评估器常以错误推理得正确标签。提出反事实凭证审计,发现高准确率掩盖脆弱性,需解耦预测与认证。

04:00
ArXiv AI

TLive-Omni:面向电商直播的全模态理解模型

电商直播全模态模型TLive-Omni,时间对齐+三阶段训练+强化微调,性能领先。

04:00
ArXiv AI

TreeWY:门控 DeltaNet 混合模型的投机验证

TreeWY树形WY变换免去快照,一次三角求解验证草稿,提交重构接受状态,省显存升吞吐降延迟。

04:00
ArXiv AI

信念无行为:衡量视觉语言模型将心智理论转化为协调社会行动的程度

提出MOSAIC基准,发现视觉语言模型无法将心智推理转为社交行动,显式约束无效,含显式心智模块者成功。

04:00
ArXiv AI

利用半结构化数据增强预测性政治问答中的大语言模型

提出双视角框架PSL,融合立场与高阶结构信号,增强大语言模型的政治预测问答,优于基线。