具有保证的数据驱动MPC加速
数据驱动加速MPC:非参数策略替代在线优化,速度快百倍,保留最优性保证。
HarmonicAttack:一种自适应跨域音频水印移除方法
提出HarmonicAttack,无需目标水印算法,跨域训练可高效移除多种音频水印,保持高感知质量。
DLEBench:评估基于指令的图像编辑模型的小物体编辑能力
提出DLEBench基准,专门评估小物体编辑能力,揭示模型性能差距。
基于多尺度结构生成的蛋白质自回归建模
提出PAR多尺度自回归框架,通过粗到细预测生成蛋白质骨架,解决暴露偏差,零样本泛化,生成高质量设计。
通过超轻量级架构在普通CPU上实现实时结肠镜息肉分割
UltraSeg超轻量模型(<0.3M参数)在普通CPU上实现50FPS实时息肉分割,Dice超0.8,性能接近大模型。
财富低语:通过提示注入对谷歌代理支付协议进行红队测试
测试发现提示注入可操纵排名和窃取数据,揭示代理支付系统的关键漏洞。
重新思考扩散模型强化学习的设计空间:似然估计的重要性超越损失设计
发现基于ELBO的似然估计是扩散模型RL优化的主导因素,比损失设计更关键,效率提升显著。
从自动化到自主化:分层原生智能体网络架构(HANA)
提出分层多智能体架构HANA,融合自我意识实现战略与应急协调,5G核心验证减少86%MTTR。
面向Horn逻辑推理的高质量嵌入
提出生成锚点、平衡正负例难度和强调最难例三种方法,提升逻辑推理效率。
$ECUAS_n$:用于原则性评估不确定性增强系统的一系列指标
提出ECUAS_n指标族,作为评分规则评估不确定性增强系统,参数n权衡预测错误与不确定性质量。
用于衡量前沿AI能力的开放世界评估
开放世界评估通过长期真实任务定性分析弥补基准局限;CRUX实例中AI仅一次干预即完成应用发布,预警前沿能力。
Mahjax: A GPU-Accelerated Mahjong Simulator for Reinforcement Learning in JAX
基于AI智能体的个性工程:谈判研究新方法
利用AI智能体参数化谈判者个性(温暖-支配维度),为谈判理论提供严格可控的测试方法。
AgentNLQ:面向自然语言到SQL的通用智能体
提出多智能体NL2SQL方法,通过语义丰富和自校正,在BIRD基准达78.1%准确率。
可信代理网络:代理网络中的信任必须内建,而非外挂
大语言模型代理构建的A2A网络存在系统性漏洞,信任必须从框架设计之初内建,而非事后补丁。
DecisionBench:长时域自主工作流中的涌现式委托基准
长时域自主工作流委托基准发现:质量无差异,路由保真度低,反事实上限显示15–31%提升空间。
Operationalizing Document AI: A Microservice Architecture for OCR and LLM Pipelines in Production
KAN-MLP-Mixer:利用Kolmogorov-Arnold网络改进基于IMU的人体活动识别的全面研究
提出KAN-MLP混合架构,结合KAN嵌入与MLP混合及LarctanKAN分类,8个数据集宏F1提升5.33%,优于纯KAN和MLP。
干扰感知的多任务遗忘
提出干扰感知框架,融合任务梯度投影与实例正交化,解决多任务遗忘中的干扰问题。
观点:让我们开发数据探针,从根本上理解数据如何影响大语言模型性能
呼吁开发数据探针,通过合成序列系统探究数据特征对LLM性能的根本影响,超越经验启发式。
引出式嵌入:系统提示贝叶斯优化的动态表征
ReElicit通过LLM引出动态特征空间进行贝叶斯优化,在30次评估预算内实现最优系统提示性能。
评估个人健康记录在个性化健康人工智能中的效用
研究显示PHR数据可显著提升LLM回答健康问题的质量,但存在对复杂记录理解不足。
线控训练控制治理:面向稳定性与效率的压力下有界自主训练
提出有界自主训练控制层LBW-Guard,在压力下保持稳定,困惑度降低18.7%,速度提升1.10倍。
模态冲突幻觉中注意力头不平衡的因果证据
注意力头不平衡(驱动广、抵抗少)导致多模态大模型偏向错误文本,引发模态冲突幻觉;MACI干预有效抑制驱动头。
可发现的智能体知识:面向智能体知识图谱可供性的形式化框架(扩展版)
提出AAP框架作为KG语义层,解决智能体在知识图谱中的选择、组合与故障诊断问题。
SimGym:基于流量驱动的视觉语言模型代理的电商A/B测试模拟框架
SimGym用VLM代理模拟电商A/B测试,缩短周期至1小时,方向一致率达77%。
AQuaUI:基于自适应四叉树的GUI代理视觉标记缩减方法
AQuaUI利用自适应四叉树压缩GUI截图冗余,无需训练即可推理加速,减少视觉标记并保持高性能。
何时何地蒸馏:面向多轮代理的选择性事后知识蒸馏
SERL框架利用任务奖励和环境反馈聚焦关键动作,在ALFWorld和WebShop达90.0%和80.1%成功率。
Swimming with Whales: Analysis of Power Imbalances in Stake-Weighted Governance
自主交易:大语言模型智能体与金融市场的交汇
审计77项LLM交易智能体研究发现协议不可比、可重复性低,核心贡献是证据账本与报告清单。
PRISM:程序化空间时间推理基准
PRISM基准揭示程序化视频生成中代码可执行但空间不连贯的鸿沟,提供四维评估。
面向大型推理模型的强化学习越狱方法中的注意力引导奖励
通过分析注意力模式,提出强化学习结合注意力信号的越狱方法,显著提升攻击成功率与迁移性。
观点:现实世界自回归Transformer的图灵完备性高度依赖上下文管理
本文澄清Transformer图灵完备性证明混淆,强调现实部署中上下文管理决定计算能力。
高效收集集体分歧
提出分层框架与多数矩阵,定义分歧度量层次,证明成对比较不足,设计两种协议平衡人数与认知负荷。
库漂移:诊断与修复自进化LLM技能库的静默失败模式
库漂移是自进化技能库的静默失败,导致性能停滞。通过可复现触发、痕迹诊断和结果驱动治理(淘汰+上限+元技能先验)将pass@1从0.258提升至0.584。
SceneCode:面向带铰接物体的可编辑室内场景的可执行世界程序
SceneCode将自然语言提示编译为可执行代码驱动的室内世界,实现可编辑、可物理交互的场景生成。
超越理性幻觉:行为现实的战略分类
提出Pro-SF框架,基于前景理论建模认知偏差下的非完全理性战略分类,实验验证其有效性。
潜在强化学习动作投射:迈向通用可扩展的图组合优化
提出投射智能体在连续嵌入空间预测潜在动作并解码,实现16倍加速和40%泛化提升,开源LaGCO-RL库。
形式化技能:面向高效准确LLM代理的可编程运行时技能
提出形式化技能运行时抽象,以可执行状态机和钩子策略替代冗长提示,显著提升LLM代理的令牌效率与执行准确性。
EngiAI:面向LLM驱动工程设计的智能体框架与基准评测集
提出多智能体框架与三维度基准,闭源模型任务完成率96-97%,开源模型55-78%。
当表格基础模型遇到策略性表格数据:一种先验对齐方法
提出SPN方法,无需重新训练即可对齐策略性数据分布,提升鲁棒性与预测性能。
伪代码引导的结构化推理:实现视觉语言模型的自动化可靠推理
提出PStar框架,用伪代码结构化推理自适应选择策略,显著降低幻觉率,在POPE和MMStar达SOTA。
真正提升数学推理能力的是什么:超越纯代码的结构化推理信号
代码不提升推理,结构化推理信号(如代码-文本混合)才是关键,增加数学结构化样本可大幅增强推理。
面向连续AI智能体评估的无分布不确定性量化
采用分裂共形预测和自适应推断,对AI智能体评估提供无分布覆盖保证,校准误差<0.02,发布后区间自适应加宽35%并收敛。
多项逻辑MDP的极小化最优方差感知遗憾界
提出方差感知算法,遗憾界匹配下界,首次完全刻画多项逻辑混合MDP的复杂度。
中文标题:并非所有评分标准都同等有效:面向RLVR的策略感知评分奖励
中文摘要:POW3R根据策略当前表现动态调整评分标准权重,减少训练步数2.5-4倍,提升奖励与完成率。
当技能帮不上忙:进攻性网络安全中基于工具的智能体程序性知识的一项负面结果
高环境反馈带宽下,技能边际收益消失甚至降低性能,技能无用论在进攻性网络安全中得到证实。
PEEK:上下文地图作为长上下文LLM代理的定向缓存
PEEK通过可编程缓存策略构建上下文地图,提升长上下文LLM代理准确性6.3-34%,减少迭代93-145次,成本降至1/5.8。
GeoX:通过自我博弈与可验证奖励掌握地理空间推理
GeoX通过自我博弈与程序验证奖励,无需人工标注即提升地理空间推理,平均提升5.5分。
中文标题:探究具身大语言模型:更高观测保真度何时会损害问题解决
中文摘要:具身LLM在锁箱实验中,原始RGB输入表现最佳,完美观测反而最差;适度噪声可提升成功率2.85倍,表明高观测保真度未必有益。