超越静态评估:对抗游戏中LLM驱动策略演化的共进化机制
提出共进化等三种机制解决策略演化停滞,在对抗游戏中取得最优性能并产生创新战术。
ActiveMem:面向长程LLM推理的分布式主动记忆
受人类认知启发,ActiveMem解耦记忆与推理,用分布式主动记忆迭代积累语义要点,实现长程推理高精度低开销。
面向智能金融系统的统一多模态框架:融合强化学习、高频交易、博弈论方法与跨模态情感分析
提出统一多模态金融AI框架,融合强化学习、高频交易与博弈论等,在组合优化等任务上提升23.7%-31.2%,具理论收敛保证。
关于PlanGPT的补充研究:使用定义的性能指标评估并与规划器比较
补充研究显示,PlanGPT的规划性能不如贪心搜索策略,计划成本和生成时间均不占优。
HIPIF:面向长视界LLM智能体学习的层次化规划与信息折叠
HIPIF通过子目标分解与信息折叠减少长上下文干扰,结合层次化反思与子目标奖励,无需辅助模型即可提升长视界任务表现。
Moonshine:以猜想生成为核心的自主数学研究智能体
Moonshine自主生成数学猜想,以雅可比猜想为例提出神经雅可比猜想并获部分证明。
仲裁者智能体:持续监控多智能体对话以检测涌现性失调
提出仲裁者智能体,在有限检查预算下实时监控多智能体对话,有效检测涌现性失调。
AutoPDE: 通过显式表示的求解器策略实现可靠的自主偏微分方程求解
AutoPDE将求解器策略显式化,分三阶段构建维护,实现可靠自主PDE求解,通过率54.5%,提升14.2%
采用严格逐步骤验证评估研究级数学证明
提出严格逐步骤验证框架,约束推理步骤与定理来源,优于全局评估并揭示基准隐式歧义。
学习记住什么:面向长时程语言智能体的可观测安全记忆保持的约束优化方法
提出OSL-MR框架,通过约束优化实现可观测安全的记忆保持,在长时程任务中优于基线。
每多模态证据一个令牌:面向资源受限问答的潜在记忆
提出潜在记忆范式,用单个令牌代表多模态证据,在文本/视觉问答中节省3-10倍生成令牌,性能持平甚至更优。
Infini Memory:面向长期LLM智能体记忆的可维护主题文档
Infini Memory将记忆组织为主题文档,通过缓冲整理与迭代检索,在MemoryAgentBench达64.7%分数,改善长期记忆维护与证据聚合。
空空间约束低秩自适应:面向响应指定的大语言模型遗忘
提出NSRU方法,用零空间约束低秩更新实现响应指定的大模型遗忘,同时保持良性能。
大规模语义映射揭示测量与生成式AI对学习者能动性与自主性的忽视
研究发现学习者能动性与自主性分任务、个人、社会文化三维度,但现有测量和生成式AI忽视社会文化维度,窄化行为培养。
角色代理:通过双角色进化自举LLM智能体
Role-Agent框架使LLM同时作为代理与环境,通过双组件协同实现自举共进化,平均性能提升超4%。
前沿编码代理利用元编程适应陌生编程语言
前沿代理通过元编程(用Python生成并调试目标代码)适应陌生语言,禁用该策略后性能大幅下降,辅助代码可提升其他代理。
世界核:世界模型是容许可能世界的耦合核
世界模型是容许可能世界的耦合核,其非对角元素决定反事实,可被约束和近似重构。
记忆过犹不及:记忆增强模型中的谄媚评估与缓解
记忆增强模型放大谄媚最高25倍,源于记忆压缩丢失纠正上下文,提出轻量缓解方案。
建筑师蚁:可编辑的建筑平面图自动家具布置
提出AntPlan-270数据集与Architect-Ant模型,利用视觉语言模型和领域专用语言实现可编辑的自动布局,经偏好优化生成合理家具布置。
注意差距:前沿大语言模型能否通过标准化办公技能考试?
前沿LLM在办公自动化测试中表现不佳,单次模型最高36.6%,更强系统达68.8%,可靠自动化仍是挑战。
面向状态依赖可行动作集的马尔可夫决策过程的贝尔曼-泰勒分数解码
提出贝尔曼-泰勒分数解码框架,将策略学习移至欧几里得分数空间并保证可行性,实验显示近最优性能。
反馈对齐在自蒸馏中的作用
步骤对齐反馈仅纠正错误token,优于奖励或参考解法,提升自蒸馏效果16.11点。
LLM决策中的表面信念
LLM决策行为有结构可预测,但自述理由与真实驱动因素不符,体现表面信念。
面向计算机使用代理的历史感知与视觉基础批评模型
HiViG通过历史感知与视觉基础的多模态批评评估动作并拦截错误,在跨平台GUI任务中平均成功率提升5.8%-9.0%。
适合少量标记的模型不会过拟合:ML研究智能体中的压缩与泛化
通过压缩实验验证,ML研究智能体在少量标记和反馈下仍能复现高性能,支持成功策略的低复杂度解释。
ABC-Bench:面向生物安全的智能生物能力基准
ABC-Bench评估LLM代理生物安全能力,代理超越人类专家,o4-mini-high成功湿实验组装DNA。
ReasonAlloc:推理模型的分层解码时KV缓存预算分配
ReasonAlloc提出分层KV缓存预算分配,离线层间预分配与在线头间重分配,低预算下显著提升推理性能。
CollabSkill:现实任务中人机协作评估框架
93名工人实际工作数据评估人机协作,发现Claude Code领先,实践经验是协作关键。
Self-EmoQ: 普拉奇克引导的基于价值的规划以驱动流式情感文本转语音
提出情感先于文本生成的情感规划框架,用RL训练LLM模块,结合模仿与普拉奇克情感轮评分,实现流式情感TTS。
Failure Modes of Deep Multi-Agent RL in Asynchronous Pricing: Reproducible Triggers, Trace Diagnostics, and a Partial Fix
生物电信息理论:人工智能下生物电信号的理论压缩极限探究
生物电压缩极限取决于模型和任务,而非波形固有属性,可通过三级层次实现任务级信息传输。
HMAF:一种层次化多槽位GD-RTB分配框架
提出HMAF框架,采用Plan-Calibrate-Execute范式平衡短期收入与长期交付,在美团实现GD交付率+3.72%,总收入+1.59%。
IDP-Bench:评测大语言模型在相互依赖隐私场景中保护个人信息的能力
首个IDP基准评估LLM在相互依赖隐私场景的理解,发现其识别关键参数和判断分享适当性方面表现不足。
超越进化的鲸鱼:群体智能在连接组储层中最大化记忆
应用群体智能优化连接组权重,鲸鱼算法记忆容量提升17倍、误差降低89%,证实生物初始化是关键。
基于两阶段潜特征优化绕过扩散定制中的版权保护
TS-LFO通过两阶段潜特征优化恢复映射,高效绕过扩散定制版权防御。
GAGI:基于基尼调整的人均GDP指数,用于关注分配的宏观经济福利监测
GAGI指数通过基尼系数和价格调整人均GDP,揭示福利与增长脱节,是GDP监测的必要补充。
几何感知的各向异性边界修正用于气动模拟
提出GeoABC框架,利用边界几何进行方向感知修正,使神经算子近边界误差平均降低38%,提升高保真气动模拟精度。
Local Is Not a Sufficient Privacy Boundary: Governing OS-Integrated On-Device AI
流控制:通过简单的实时输入引导视觉-语言-动作模型
提出流控制法,用键盘等输入实时引导动作,无需重训,提升成功率与速度。
最优多物品多竞拍者拍卖设计的对偶性:基于深度学习的收入证书
提出深度学习对偶框架,为多物品多竞拍者拍卖生成收入上界证书,并验证近优性。
语言增强的音频语音数据 (LinguAS)
提出LinguAS数据集,含专家定义语言特征(EDLF)的800+音频样本,用于深度伪造语音检测,显著提升模型性能。
原子意图推理:将大语言模型语义引入工业级跨域推荐
提出AIR框架,离线LLM推理+在线检索组合,400倍加速,跨域推荐SOTA,GMV提升3.446%。
面向鲁棒阿拉伯语语音情感识别的深度学习方法
提出CNN-Transformer混合架构,在阿拉伯语情感识别上达98.1%准确率,优于CNN-LSTM和wav2vec2.0。
提高VLA评估中仿真与真实相关性的实用方法
系统分析仿真与真实相关性,提出衡量和改进仿真对VLA策略评估实用性的框架。
语音遇见ELF:面向语音识别与翻译的音频条件连续目标扩散模型
提出ELF-S2T模型,实现语音到文本的连续目标生成,发现ASR和S2TT错误均源于连续空间近距离混淆。
测试时对抗性接管:针对机器人扩散策略的实时劫持接口
提出TAKO攻击,通过可重用补丁实时接管机器人策略,实现远程操控,成功率达100%。
递归神经网络中的临界分支机制研究
小LSTM网络接近最优训练时呈现近临界动力学,大网络亚临界;混合分支过程解释亚临界分支与长程时间相关共存。
针对边缘保持攻击的分布式可检测性带
构造边缘保持攻击使分布形状监视器失效,时序相关监视器可检测,展示非空可检测性带。
从数据异构到收敛:联邦学习的数据视角综述
该综述从数据视角剖析联邦学习中异质性、分裂实践及漏洞防御对收敛的影响,提供可操作指导。
公平真的公平吗?通过固定δ对齐实现多任务学习中可靠的Lipschitz公平性
提出ReLiF框架,用固定δ审计解决多任务学习公平性评估的阈值混淆问题,揭示真实权衡。