InteractScience:交互式科学演示代码生成的程序化与视觉基础评估
提出InteractScience基准,结合程序化与视觉测试评估LLM生成交互式科学演示代码能力,揭示其在领域知识与编码整合上的不足。
ATLAS:基于动态提示优化与多智能体协调的LLM智能体自适应交易
提出ATLAS框架,通过动态提示优化与多智能体协调,实现延迟反馈下的自适应交易,提升决策性能。
面向平滑连续控制的隐式动作分块
提出双窗口平滑(DWS)隐式动作分块框架,实现平滑连续控制,优于现有方法。
针对不规则多元时间序列的潜在拉普拉斯扩散模型
LLapDiff通过潜在轨迹和拉普拉斯域极点实现不规则多元时间序列的长期预测与插补。
MiMuon:面向大模型的混合Muon优化器及其增强泛化能力
提出MiMuon优化器,泛化误差低于Muon,收敛速率相同,实验验证有效。
评估自主安全代理中的安全对齐效应
安全对齐模型在自主任务中表现差异大,需系统级测量拒绝、不安全行为、工具可靠性与证据基础。
AR1-ZO:面向高秩LoRA微调的拓扑感知秩1零阶查询
提出AR1-ZO,用拓扑感知秩1原子查询和缩放恢复信号,解决高秩LoRA零阶微调信号退化。
中文标题:一种面向异构数据流的闭环、以状态为中心的多智能体乘客负荷估计框架
中文摘要:提出闭环、状态中心的多智能体框架,借助物理约束、动态信任分配与残差反馈,实现鲁棒乘客负荷估计。
块球向量量化
统一比较旋转量化器,提出块球量化BlockQuant,理论改进MSE和内积失真。
ST-TGExplainer:为时序图神经网络可解释性解耦稳定模式与过渡模式
ST-TGExplainer通过解耦稳定与过渡模式,利用信息瓶颈学习紧凑解释性子图,提升TGNN可解释性与预测性能。
平滑分段切割神经算子处理不连续性与尖锐过渡
提出Cut-DeepONet,通过提升策略将域划分为光滑子区域并显式建模不连续性,在低分辨率数据下仍优于现有方法。
快速且无特征的节点表示学习(基于部分成对监督)
提出Contrastive FUSE,无需节点特征,结合社区结构与成对约束的谱对比学习,高效优化实现快速节点表示。
深空科技:空间数据中心与边缘AI革命
空间数据中心通过星上AI实时处理数据,缓解星地链路拥塞,实现低延迟服务。
检测基于序列熵变化的流畅优化对抗提示
提出在线变化点检测方法CPD,基于熵流和CUSUM统计量,无需训练即可定位对抗后缀,在多个模型上F1达0.82。
具有前瞻性的学习:通过多节点前瞻预测增强神经路由策略
提出多节点前瞻预测训练策略,使神经策略具备多步预测能力,提升泛化性能且无额外推理开销。
少草拟,多检索:投机解码中的混合树构建
提出Graft框架,通过剪枝释放预算并用检索补偿覆盖损失,实现无训练无损的投机解码加速,速度提升达5.41倍。
代理调优案例:从文档到PostgreSQL中的行动
PerfEvolve将专家调优方法转化为LLM代理技能,实现版本验证、负载分析和多参数联合优化,性能提升35.2%。
用最优双贝叶斯学习训练神经网络
提出双贝叶斯框架导出理想学习率,用于SGD,实验验证其有效性。
LLM基准数据集应具有抗污染性
呼吁开发抗污染的基准数据集,利用Transformer推理-训练不对称性,确保LLM评估可靠性。
When Critics Disagree: Adaptive Reward Poisoning Attacks in RIS-Aided Wireless Control System
代码整洁性会影响编码智能体吗?一项受控的最小配对研究
代码整洁性不影响智能体通过率,但降低7-8%令牌消耗和34%文件重访,影响计算成本与效率。
面向真实世界ROS~2系统的LLM辅助架构恢复:基于智能体的多级层次结构架构重建方法
提出基于LLM和蓝图的多级中间表示与分阶段恢复策略,在真实ROS 2系统中验证了结构一致性与可扩展性。
INSHAPE:面向可解释时间序列分类的实例级形状特征
INSHAPE通过发现实例级可变长度判别模式并建模时间依赖,实现强预测与可解释性,性能优于现有方法。
基于回答集编程的长期电网规划
首次用回答集编程自动化优化长期电网规划,简洁编码复杂约束,实验验证有效。
人工幻象:大型语言模型中的涌现式心理意象
LLM在视觉想象任务上超越人类,证明语言驱动的命题表征可产生无需图像的心理意象,挑战传统认知。
k-归纳神经障碍证书用于未知非线性动力学
利用数据驱动和CEGIS-SMT,为部分未知非线性系统构建k-归纳神经障碍证书,放宽严格约束,提升灵活性。
思想原子:基于微状态的通用脑电图表征学习
本文提出基于微状态的通用EEG表征,构建分词器,在多项任务中优于传统特征,更可解释。
Sonar-TS:面向时序数据库的搜索-验证式自然语言查询
提出Sonar-TS框架,通过搜索-验证流水线实现时序数据库自然语言查询,并构建基准,有效解决传统方法难题。
ARM:发现可泛化多智能体系统的代理推理模块
提出ARM模块,通过代码空间树搜索优化CoT推理,显著提升多智能体系统性能并实现跨任务泛化。
从拒绝到恢复:基于控制理论的生成式AI防护栏方法
基于控制理论构建生成式AI防护栏,实时监控并主动纠正风险输出,避免灾难后果同时保持任务性能。
分布式通用人工智能安全
AI安全应关注通过群体协调涌现的AGI风险,提出分布式AGI安全框架,以虚拟沙盒经济管理智能体交易。
非线性即秩:基于径向基函数的生成式低秩适配器
GenLoRA用径向基函数生成基向量替代显式存储,以更少参数实现更高有效秩,显著提升微调性能。
TSR:面向LLM智能体多轮强化学习的轨迹搜索展开策略
TSR在训练时用轻量树搜索生成高质量轨迹,结合PPO/GRPO,提升多轮RL性能最多15%。
面向智能体强化学习的相位感知混合专家模型
PA-MoE通过相位路由器学习相位边界,实现时间一致性专家分配,解决简单偏差问题。
对比推理对齐:基于隐藏表示的强化学习
CRAFT框架通过隐藏表示对比学习和强化学习,分离安全与不安全推理轨迹,显著提升模型鲁棒性。
Governing Evolving Memory in LLM Agents: Risks, Mechanisms, and the Stability and Safety Governed Memory (SSGM) Framework
通过动态参数校准与多任务学习的作物预测混合建模框架
提出混合建模框架,用神经网络参数化生物物理模型并多任务学习,在数据有限时提升作物状态预测精度60%和40%。
自生成:一种自进化智能体协议
提出AGP自进化协议,分离进化内容与方式,实现资源管理与闭环进化,构建AGS系统,在长程任务中持续改进。
面向基于大模型空间构建的2.5D分解
提出2.5-D分解:LLM仅规划2D平面,垂直由确定性模块计算,构建准确率达94.6%。
TMAS:通过多智能体协同扩展测试时计算
提出TMAS框架,借助多智能体协同、分层记忆与混合奖励训练,有效提升推理扩展能力。
Faster-GCG:针对对齐大语言模型的高效离散优化越狱攻击
提出Faster-GCG,通过距离正则化、温度控制采样和已访问标记,将GCG评估从256K降至32K,效率提升8倍,平均成功率78.1%。
CBT-Audio:评估音频语言模型对CBT录音中患者痛苦强度的估计
引入CBT-Audio数据集,评估音频语言模型估计患者痛苦强度,发现音频结合文本优于纯文本,显著提升多数模型表现。
Skim:面向快速高效网络代理的推测执行
利用网站结构预测,轻量级模板匹配快速执行,降低1.9倍成本与33.4%延迟,无精度损失。
仅靠回忆是不够的:个性化语言系统中的承诺限定
提出CBEA+LCV方法实现承诺控制,零失败可用性0.49-0.60,回忆率仅0.012,输入负载降低74-75%。
潜在动作重参数化:提升智能体推理效率
提出LAR框架,学习紧凑潜在动作空间,以多步语义行为缩短决策周期,减少推理成本并保持成功率。
Slot-MLLM:面向多模态大语言模型的以对象为中心的视觉分词化
提出基于Slot Attention的离散槽令牌编码器,提升多模态大模型对局部细节的理解与生成能力。
量化癫痫发作检测中的泛化差距:基于SzCORE挑战的大规模实证基准
评估28种算法于65名患者4360小时EEG数据,最佳F1仅32%,揭示自报效能与真实性能的巨大差距,强调标准化基准。
中文标题:针对自动化算法设计的大型语言模型微调
中文摘要:提出多样性感知排序采样与直接偏好优化,微调LLM用于算法设计,实验表明微调模型显著优于通用模型且泛化良好。
折扣MDP中的递归熵风险优化:基于生成模型的样本复杂度界
递归熵风险MDP样本复杂度指数依赖风险参数与折扣因子,界紧于状态动作数。
PiKV:面向混合专家模型的KV缓存管理系统
PiKV针对MoE架构,通过专家分片、路由、调度和压缩,降低KV缓存的内存与通信开销。