5963 条条目 · 106 个活跃源
2026年7月1日
04:00
ArXiv AI

超越专家用户:智能体应帮助用户构建偏好,而非仅仅引导其表达

智能体常假设用户为专家,但用户需帮助才能构建偏好,现有模型在帮助用户获知所需知识方面表现不足。

04:00
ArXiv AI

何时学习停止有帮助?推理模型中早期退出的成本感知研究

学习停止在自由形式数学中提升固定预算前沿,但在多项选择和困难任务中简单标量退出更具竞争力。

04:00
ArXiv AI

RoPoLL:鲁棒的LLM评委小组

RoPoLL用几何中位数聚合,在偏置污染下大幅优于传统LLM评委小组。

04:00
ArXiv AI

为何重复解决?面向迁移高效的ML工程的分层技能积累

分层加载技能实现100%奖牌率(扁平仅62.5%),热启动减少52%迭代,知识组织可替代模型强度。

04:00
ArXiv AI

探究法律中的多智能体商议

多智能体商议在法律推理中表现与基线相当但答案独特,可互补解决难题,适合多角度批判性思考。

04:00
ArXiv AI

AgentBound:自主AI代理的可验证行为治理

AgentBound通过三方权威评估动作,生成加密可验证收据,实现可独立验证的问责制。

04:00
ArXiv AI

HyPOLE:超属性引导的部分可观测多智能体强化学习

HyPOLE框架用超属性HyperLTL引导部分可观测多智能体强化学习,结合CTDE,在多个基准上优于基线。

04:00
ArXiv AI

DDIAgents:机制条件化上下文流用于药物相互作用预测

提出机制条件化多智能体框架,动态编排知识、协同专家推理,实现可解释且优于基线的药物相互作用预测。

04:00
ArXiv AI

中文标题

人工智能体调节负担具有历史依赖性,形成滞后效应,预期调节可降低控制需求。

04:00
ArXiv AI

超越编译:评估从自然语言到Lean的忠实语句形式化

编译通过不代表语义忠实,评估揭示29%差距,建议分开报告形式有效性、证明能力与忠实形式化。

04:00
ArXiv AI

面向税务感知的个性化投资组合管理的三阶段基础模型

提出三阶段深度强化学习系统,通过跨资产编码器、MoE多目标优化和LoRA个性化,实现税务感知的个性化投资组合管理。

04:00
ArXiv AI

朝向包容性移动建模:城市系统中老年人轨迹模式的特征化与评估

研究发现老年人移动轨迹具有局部化、低熵、非高峰特点,专用模型比主流数据训练的模型更准确。

04:00
ArXiv AI

通过Transformer揭示UTM安全关键场景

利用Transformer建模序列,结合注意力机制和风险奖励,高效发现UTM漏洞及遗漏边缘情况,效率提升8倍。

04:00
ArXiv AI

往昔为序章:一种用于序列演进LLM记忆中选择性更新的插件控制器

提出Janus插件控制器,利用记忆动量触发器和混合评估决定是否接受记忆更新,平均准确率提升2.7-4.6点。

04:00
ArXiv AI

ClawArena-Team:语言模型智能体子智能体编排与动态工作流基准测试

新基准测试LLM作为管理者的子智能体编排与权限控制能力。

04:00
ArXiv AI

使用真实世界故障记录为自动驾驶系统测试生成场景

利用历史故障记录和LLM生成多样化测试场景,可在有限预算内有效发现系统故障。

04:00
ArXiv AI

超越库:一个用于自动形式化研究数学的智能体框架

提出智能体框架自动形式化研究数学,使用通用编码LLM动态扩展类型并验证,成功形式化32道Putnam题及5篇STOC论文定理。

04:00
ArXiv AI

代理式RAG-VLM:面向机器人抓取的功能感知检索增强生成与自我反思规划

提出功能感知检索、场景图推理与自我反思规划框架,抓取成功率78.3%,较纯VLM提升53.3个百分点。

04:00
ArXiv AI

6G网络中联合OFDM波形设计与RIS配置的优化算法:从凸松弛到基础模型

综述联合OFDM-RIS优化四类方法,ML推理快且达95-99%谱效,但缺标准基准与跨论文比较。

04:00
ArXiv AI

基于结构化自回归建模的长期交通仿真

提出RosettaSim框架,利用LLM实现长期交通仿真,并引入RTE评估方法,在WOSAC上达到SOTA。

04:00
ArXiv AI

思考先行:基于战略规划与自我批评的鲁棒零样本组合图像检索

提出PEC-CIR框架,通过规划-执行-批评多阶段推理构建查询,提升零样本组合图像检索的鲁棒性。

04:00
ArXiv AI

中文标题:代理构思:面向科学构思代理的样本高效代理轨迹合成

提出Agentic-Ideation框架,采用Oracle引导策略高效合成轨迹并训练代理LLM,质量提升11.91%,样本效率提升10倍以上。

04:00
ArXiv AI

Delta-JEPA:通过潜在差异解码学习对动作敏感的世界模型

Delta-JEPA用潜在差异解码监督动作,防止表示塌缩,学习动作敏感世界模型,提升连续控制规划性能。

04:00
ArXiv AI

通过语言与符号表征之间的模态切换进行空间推理

研究将文本空间故事转为几何模态(如网格),使LLM性能提升42%,并提出基于可信度与复杂度的模态切换度量。

04:00
ArXiv AI

CryoACE:面向原子的冷冻电镜精确自动建模框架

CryoACE原子中心框架,从密度图精确重建原子结构,静态动态均优于现有方法。

04:00
ArXiv AI

ReGRPO:面向工具使用智能体的反射增强策略优化

ReGRPO通过反思三元组联合优化反射与纠正动作,在多工具任务中超越强基线,取得最佳性能。

04:00
ArXiv AI

世界模型崩溃的相变现象

长时域语言智能体世界模型在临界边界处突现相变式崩溃,状态保真度先于动作失效,构成可测量瓶颈。

04:00
ArXiv AI

(AI)群体智慧:探究大型语言模型中的人工群体智能

LLM群体聚合可大幅降低错误(MAPE最高降37%),且具备不确定性元认知能力。

04:00
ArXiv AI

学习选择而非重新学习:推理LoRA的硬路由混合

提出硬路由混合框架,通过硬顶级路由选择单一冻结LoRA专家,保留行为且参数更少,实现高效组合。

04:00
ArXiv AI

行动前先问世界:预算受限的环境探查用于世界模型校准

智能体在行动前探查环境校准世界模型,按任务结构选择探查类型可有效降低长期决策误差。

04:00
ArXiv AI

CSTrader:社区驱动虚拟资产市场中语言驱动交易的测试平台

利用LLM将非结构化文本转化为交易决策,在CS2皮肤市场实现7.58%累计收益,优于市场指数和简单基线。

04:00
ArXiv AI

中文标题

提出代理化编排的分类框架、定性决策标准与定量评估指标,平衡LLM代理自主性与流程鲁棒性。

04:00
ArXiv AI

健康科学中的科学解释:因果性、信任与认识充分性

从哲学视角审视医学AI解释,强调因果、信任与认识充分性,为临床XAI设计原则。

04:00
ArXiv AI

ACE:跨智能体的可插拔自适应上下文弹性化器

ACE即插即拔模块,自适应弹性编排历史信息,无损维护,为LLM智能体提供紧凑丰富上下文,显著提升性能。

04:00
ArXiv AI

严重类别不平衡下个体缺勤预测的时间序列分类框架

提出时间序列分类框架分离历史序列与未来标签,采用BFL及G-Mean损失处理严重不平衡,LSTM-FCN模型实现约80%平衡准确率。

04:00
ArXiv AI

面向ARC-AGI-2的模态驱动搜索与整体轨迹评判

提出模态驱动搜索与整体评判方法,在ARC-AGI-2上达72.9%准确率,超GPT-5.2 Pro 18.7个百分点,每任务成本低于40美元。

04:00
ArXiv AI

Which Tokens Matter? Adaptive Token Selection for RLVR with the Relative Surprisal Index

04:00
ArXiv AI

一次反思不够:基于多假设失败归因的自纠正自主研究

SAGE通过多假设失败归因实现结构化因果诊断,将可靠成果产出率从42%提升至92%,质量达6.75/10。

04:00
ArXiv AI

大型数据库需要小型、开放权重语言模型

本地量化开放权重模型替代昂贵闭源API,成本降低390倍、延迟降低3.8倍。

04:00
ArXiv AI

RAISE:基于大语言模型的鲁棒对抗实例搜索自动化启发式设计

RAISE框架在LLM进化搜索中集成对抗实例搜索,显著提升启发式设计在分布偏移下的鲁棒性。

04:00
ArXiv AI

一个加速植物表型组学科学发现的自主AI框架

提出端到端自主AI框架,将高通量植物表型数据分析从数天缩短至秒级交互,加速科学发现。

04:00
ArXiv AI

创造智能:通用人工智能的计算基础

提出基于集合论与超维计算的离散认知理论,以子集模式匹配实现常数时间联想记忆,开辟高能效人造智能新路径。

04:00
ArXiv AI

面向工业级车辆路径问题的自适应先聚类后路径分解方法

提出自适应CFRS系统,利用大语言模型动态分解,在50万客户实例中展现竞争力与可扩展性。

04:00
ArXiv AI

AxDafny:Dafny中的智能体化验证代码生成

AxDafny是验证器引导的Dafny代码生成框架,验证成功率大幅提升至92.7%。

04:00
ArXiv AI

异构学生支持需求下的合格教育能力规划:一个合成基准与决策支持框架

提出合成基准与决策框架,揭示新资格获取时效决定最优策略:及时则闭环胜,否则静态保险优。

04:00
ArXiv AI

代理门控生成与基础模型嵌入用于贝叶斯材料设计

在固定预算下,基于排名选择的代理门控以约五分之一调用量逼近全量oracle性能,最佳组合为ORB嵌入+高斯过程,已开源。