DART-VLN:面向离散视觉-语言导航的测试时记忆衰减与防循环正则化
提出无训练DART-VLN框架,融合记忆衰减与防循环正则化,不增参数,减少回溯,提升导航效率与可靠性。
LongVQUBench:评估视觉-语言模型长期视频质量理解的基准
LongVQUBench评估长视频质量理解,含三级推理与针形失真检测,揭示模型长程整合能力不足。
MemSyco-Bench:智能体记忆中的谄媚行为基准测试
提出MemSyco-Bench基准,评估LLM智能体因记忆引起的谄媚问题,涵盖拒绝、范围、冲突、更新、个性化五任务。
廉价代码,昂贵判断:可治理的代理式软件工程案例研究
AI使代码生产廉价但需工程判断治理,通过案例提出治理转换理论:高速代理实现暴露失败,工程判断转化为持久机制。
超越专家用户:智能体应帮助用户构建偏好,而非仅仅引导其表达
智能体常假设用户为专家,但用户需帮助才能构建偏好,现有模型在帮助用户获知所需知识方面表现不足。
何时学习停止有帮助?推理模型中早期退出的成本感知研究
学习停止在自由形式数学中提升固定预算前沿,但在多项选择和困难任务中简单标量退出更具竞争力。
RoPoLL:鲁棒的LLM评委小组
RoPoLL用几何中位数聚合,在偏置污染下大幅优于传统LLM评委小组。
为何重复解决?面向迁移高效的ML工程的分层技能积累
分层加载技能实现100%奖牌率(扁平仅62.5%),热启动减少52%迭代,知识组织可替代模型强度。
探究法律中的多智能体商议
多智能体商议在法律推理中表现与基线相当但答案独特,可互补解决难题,适合多角度批判性思考。
AgentBound:自主AI代理的可验证行为治理
AgentBound通过三方权威评估动作,生成加密可验证收据,实现可独立验证的问责制。
HyPOLE:超属性引导的部分可观测多智能体强化学习
HyPOLE框架用超属性HyperLTL引导部分可观测多智能体强化学习,结合CTDE,在多个基准上优于基线。
DDIAgents:机制条件化上下文流用于药物相互作用预测
提出机制条件化多智能体框架,动态编排知识、协同专家推理,实现可解释且优于基线的药物相互作用预测。
中文标题
人工智能体调节负担具有历史依赖性,形成滞后效应,预期调节可降低控制需求。
超越编译:评估从自然语言到Lean的忠实语句形式化
编译通过不代表语义忠实,评估揭示29%差距,建议分开报告形式有效性、证明能力与忠实形式化。
面向税务感知的个性化投资组合管理的三阶段基础模型
提出三阶段深度强化学习系统,通过跨资产编码器、MoE多目标优化和LoRA个性化,实现税务感知的个性化投资组合管理。
朝向包容性移动建模:城市系统中老年人轨迹模式的特征化与评估
研究发现老年人移动轨迹具有局部化、低熵、非高峰特点,专用模型比主流数据训练的模型更准确。
通过Transformer揭示UTM安全关键场景
利用Transformer建模序列,结合注意力机制和风险奖励,高效发现UTM漏洞及遗漏边缘情况,效率提升8倍。
往昔为序章:一种用于序列演进LLM记忆中选择性更新的插件控制器
提出Janus插件控制器,利用记忆动量触发器和混合评估决定是否接受记忆更新,平均准确率提升2.7-4.6点。
ClawArena-Team:语言模型智能体子智能体编排与动态工作流基准测试
新基准测试LLM作为管理者的子智能体编排与权限控制能力。
使用真实世界故障记录为自动驾驶系统测试生成场景
利用历史故障记录和LLM生成多样化测试场景,可在有限预算内有效发现系统故障。
超越库:一个用于自动形式化研究数学的智能体框架
提出智能体框架自动形式化研究数学,使用通用编码LLM动态扩展类型并验证,成功形式化32道Putnam题及5篇STOC论文定理。
代理式RAG-VLM:面向机器人抓取的功能感知检索增强生成与自我反思规划
提出功能感知检索、场景图推理与自我反思规划框架,抓取成功率78.3%,较纯VLM提升53.3个百分点。
6G网络中联合OFDM波形设计与RIS配置的优化算法:从凸松弛到基础模型
综述联合OFDM-RIS优化四类方法,ML推理快且达95-99%谱效,但缺标准基准与跨论文比较。
基于结构化自回归建模的长期交通仿真
提出RosettaSim框架,利用LLM实现长期交通仿真,并引入RTE评估方法,在WOSAC上达到SOTA。
思考先行:基于战略规划与自我批评的鲁棒零样本组合图像检索
提出PEC-CIR框架,通过规划-执行-批评多阶段推理构建查询,提升零样本组合图像检索的鲁棒性。
中文标题:代理构思:面向科学构思代理的样本高效代理轨迹合成
提出Agentic-Ideation框架,采用Oracle引导策略高效合成轨迹并训练代理LLM,质量提升11.91%,样本效率提升10倍以上。
Delta-JEPA:通过潜在差异解码学习对动作敏感的世界模型
Delta-JEPA用潜在差异解码监督动作,防止表示塌缩,学习动作敏感世界模型,提升连续控制规划性能。
通过语言与符号表征之间的模态切换进行空间推理
研究将文本空间故事转为几何模态(如网格),使LLM性能提升42%,并提出基于可信度与复杂度的模态切换度量。
CryoACE:面向原子的冷冻电镜精确自动建模框架
CryoACE原子中心框架,从密度图精确重建原子结构,静态动态均优于现有方法。
ReGRPO:面向工具使用智能体的反射增强策略优化
ReGRPO通过反思三元组联合优化反射与纠正动作,在多工具任务中超越强基线,取得最佳性能。
世界模型崩溃的相变现象
长时域语言智能体世界模型在临界边界处突现相变式崩溃,状态保真度先于动作失效,构成可测量瓶颈。
(AI)群体智慧:探究大型语言模型中的人工群体智能
LLM群体聚合可大幅降低错误(MAPE最高降37%),且具备不确定性元认知能力。
学习选择而非重新学习:推理LoRA的硬路由混合
提出硬路由混合框架,通过硬顶级路由选择单一冻结LoRA专家,保留行为且参数更少,实现高效组合。
行动前先问世界:预算受限的环境探查用于世界模型校准
智能体在行动前探查环境校准世界模型,按任务结构选择探查类型可有效降低长期决策误差。
CSTrader:社区驱动虚拟资产市场中语言驱动交易的测试平台
利用LLM将非结构化文本转化为交易决策,在CS2皮肤市场实现7.58%累计收益,优于市场指数和简单基线。
中文标题
提出代理化编排的分类框架、定性决策标准与定量评估指标,平衡LLM代理自主性与流程鲁棒性。
健康科学中的科学解释:因果性、信任与认识充分性
从哲学视角审视医学AI解释,强调因果、信任与认识充分性,为临床XAI设计原则。
ACE:跨智能体的可插拔自适应上下文弹性化器
ACE即插即拔模块,自适应弹性编排历史信息,无损维护,为LLM智能体提供紧凑丰富上下文,显著提升性能。
严重类别不平衡下个体缺勤预测的时间序列分类框架
提出时间序列分类框架分离历史序列与未来标签,采用BFL及G-Mean损失处理严重不平衡,LSTM-FCN模型实现约80%平衡准确率。
面向ARC-AGI-2的模态驱动搜索与整体轨迹评判
提出模态驱动搜索与整体评判方法,在ARC-AGI-2上达72.9%准确率,超GPT-5.2 Pro 18.7个百分点,每任务成本低于40美元。
Which Tokens Matter? Adaptive Token Selection for RLVR with the Relative Surprisal Index
一次反思不够:基于多假设失败归因的自纠正自主研究
SAGE通过多假设失败归因实现结构化因果诊断,将可靠成果产出率从42%提升至92%,质量达6.75/10。
大型数据库需要小型、开放权重语言模型
本地量化开放权重模型替代昂贵闭源API,成本降低390倍、延迟降低3.8倍。
RAISE:基于大语言模型的鲁棒对抗实例搜索自动化启发式设计
RAISE框架在LLM进化搜索中集成对抗实例搜索,显著提升启发式设计在分布偏移下的鲁棒性。
一个加速植物表型组学科学发现的自主AI框架
提出端到端自主AI框架,将高通量植物表型数据分析从数天缩短至秒级交互,加速科学发现。
创造智能:通用人工智能的计算基础
提出基于集合论与超维计算的离散认知理论,以子集模式匹配实现常数时间联想记忆,开辟高能效人造智能新路径。
面向工业级车辆路径问题的自适应先聚类后路径分解方法
提出自适应CFRS系统,利用大语言模型动态分解,在50万客户实例中展现竞争力与可扩展性。
AxDafny:Dafny中的智能体化验证代码生成
AxDafny是验证器引导的Dafny代码生成框架,验证成功率大幅提升至92.7%。
异构学生支持需求下的合格教育能力规划:一个合成基准与决策支持框架
提出合成基准与决策框架,揭示新资格获取时效决定最优策略:及时则闭环胜,否则静态保险优。
代理门控生成与基础模型嵌入用于贝叶斯材料设计
在固定预算下,基于排名选择的代理门控以约五分之一调用量逼近全量oracle性能,最佳组合为ORB嵌入+高斯过程,已开源。