利用AI驱动的形式证明搜索推进数学研究
AI形式证明搜索自主解决9个Erdos问题与44个OEIS猜想,成本数百美元,展示强大能力。
LCGuard:面向多智能体系统中安全KV共享的潜在通信守卫
LCGuard通过对抗训练学习表示级变换,减少KV共享中的敏感信息泄漏,平衡安全与性能。
门控DeltaNet-2:在线性注意力中解耦擦除与写入
提出Gated DeltaNet-2,分离通道级擦除与写入门,线性注意力性能领先,长上下文检索优势显著。
自主LLM代理与CTF:再审视
重新评估LLM代理在CTF中的表现,发现通用代理是强基线,结构化编排优于单一设计,但仍未达到人类水平。
高速网络助力千兆级AI工厂
NVIDIA Spectrum-X多平面架构通过硬件加速负载均衡实现微秒级响应和98%线速率,保障大规模AI训练网络性能。
RefusalBench:为何拒绝率在生物研究提示中错误排序前沿大语言模型
RefusalBench发现前沿模型拒绝率差异极大,但无法反映真实安全校准,部分模型存在隐蔽的“部分合规”行为。
中文标题
图神经网络解释揭示生物网络中疾病相关枢纽的拓扑特征,集成梯度和层相关传播能识别信号,共识评分提升癌症基因排序。
韩国能见度临近预报:处理类别不平衡和分布迁移的机器学习方法
韩国六城能见度临近预报采用SMOTENC与CTGAN应对不平衡,发现时间分布迁移致性能下降,需关注环境变化。
中文标题:无需预处理与因果充分性假设的平均因果效应估计中的局部协变量选择
中文摘要:提出一种局部学习方法,避免预处理和因果充分性假设,通过局部边界与识别程序实现高效准确的因果效应估计。
高效粒子喷注标记的块分层注意力Transformer
提出PHAT-JeT模型,融合几何消息传递与分层块注意力,资源受限下实现喷注标记最高精度。
速度提升,学习减少:生成式AI缩短了数学题学习时间,削弱了知识构建
生成式AI显著减少学习时间并损害长期知识保留,监考下差异消失但保留题正确率下降25%,出现“认知放弃”现象。
自适应批规模调整的可扩展在线强化学习
提出自适应批缩放,通过行为散度动态调整批大小,兼顾早期可塑性与后期收敛,打破传统RL大批量训练局限。
面向广告市场的支持度感知离线策略选择
提出支持感知离线决策框架,输出认证策略而非点估计,在广告市场减少候选并确保无伤害。
训练算法的热力学不可逆性
建立训练算法不可逆性框架,证明四种表征等价,揭示对称性破缺与最小熵产生率偏好。
面向下一代电力系统的工程混合物理信息神经网络:最新综述
综述混合物理信息神经网络在电力系统中的应用,嵌入物理定律提升预测精度与效率,优于纯数据驱动方法,但面临训练不稳定等挑战。
从补丁到轨迹:软件工程智能体的特权过程监督
提出P2T方法,利用参考补丁优化轨迹,提升软件工程智能体有效性和效率,Pass@1提升10.8点,推理成本降低15%。
基于大语言模型检索的稳定可预测广告推荐
提出基于微调LLM的语义候选生成框架,提升广告推荐的稳定性与可预测性,经大规模工业A/B实验验证有效。
边缘环境中大规模矩阵的安全并行行列式计算
针对边缘环境提出安全并行行列式计算框架,通过轻量加密和并行分解实现高效隐私保护。
保护文本到图像生成模型免受未经授权的知识蒸馏
WaveGuard通过频率感知扰动保护合成图像,在保持视觉质量下降低被窃取训练的有效性。
尚未:人类在Colonel Blotto锦标赛中胜过LLM
人类在Colonel Blotto比赛中使用更优策略战胜LLM,且策略不受对手类型影响。
TimeGuard:针对时间序列预测后门防御的通道池训练
提出TimeGuard后门防御方法,采用通道池训练与距离正则化损失选择,鲁棒性提升1.96倍,干净性能损失<5%。
原子级蛋白质表示学习提升蛋白质结构预测
提出TriProRep,通过结构感知预训练联合三个残基级视角,提升蛋白质结构预测,并引入新基准RepSP。
SWE-Mutation:大语言模型能否生成可靠的软件工程测试套件?
提出SWE-Mutation基准,通过变异测试发现LLM生成的测试套件检测率低,当前模型能力不足。
大气湍流与指向误差对地球观测的影响
提出模拟大气湍流与指向抖动的图像生成器,船舶检测显示YOLOv8性能严重下降,RetinaNet更稳健,强调训练数据需包含物理退化。
针对时间、空间和语义逃逸的自主智能体基准测试
提出时间、空间、语义三种逃逸攻击,构建A3S-Bench基准测试,发现自主智能体风险触发率从28.3%升至52.6%,暴露系统级漏洞。
ACCoRD: 基于深度学习的O-RAN xApps行动者-评论家冲突解决
提出强化学习冲突解决机制,显著减少O-RAN中高流量场景下的控制冲突负面事件。
Sibyl-AutoResearch:自主研究需要自我进化的试错框架,而非论文生成器
Sibyl-AutoResearch提出自主研究需试错框架,通过两种转化单元实现经验积累与系统自我进化,审计证实其可行性。
纳什集成多智能体强化学习实现激励对齐的车对车能源交易
提出Nash-MADDPG方法,优化车对车能源交易,社会福利提升61.6%,交易量提升62.9%,公平性提升40.1%。
基于时间异步对齐对比学习的跨被试脑电情感识别
提出TA2CL框架,用细粒度局部匹配解决跨被试时间延迟,在多个数据集取得高准确率,验证了有效性和泛化能力。
BioFormer:通过频谱结构对齐重新思考生物医学时间序列跨受试者泛化
提出频谱漂移视角,用频带对齐模块和样本条件层归一化抑制受试者变异,F1提升6%。
中文标题:理解动作分块行为克隆中的多模态失败
中文摘要:研究动作分块策略中多模态失败机制:潜在变量需平衡正则化,生成策略受平滑性限制。
图神经网络中小批量训练的隐式正则化
随机节点采样因降低梯度方差实现隐式正则化,性能媲美全图训练且更高效。
一种微控制器上激活函数的恒定时间实现方法
提出微控制器上激活函数的恒定时间实现方法,通过无分支选择、固定成本近似消除时序泄露,实现稳定周期与高精度。
神经编译器:面向混合科学机器学习的程序到网络翻译
神经编译器将符号程序编译为可微模块,精确编码物理,少量参数高效学习,误差远低于PINN,支持系统组合。
稳定网络安全AI中的可解释性脆弱性:公共基准数据集中多重共线性的影响与缓解
揭示多重共线性导致解释不稳定,提出脆弱性评分和两种缓解方法,提升XAI可靠性。
组合奖励下流模型的冲突感知加性引导
提出冲突感知加性引导,动态检测并解决梯度冲突以纠正生成模型离流形漂移,高效保真。
COAgents:用于学习和导航路径规划问题搜索空间的多智能体框架
COAgents多智能体框架图建模搜索,动态构建部分搜索图,训练智能体引导,在VRPTW上性能领先。
我们应该出拳多久?——在格斗游戏中学习动作持续时间
学习动作持续时间可匹配固定跳帧性能,但低响应性(高跳帧)更易形成重复剥削策略。
DPO与RLHF的条件等价性:隐含假设、失败模式与可证明对齐
DPO等价RLHF依赖隐含假设,违背时优化失准。CPO加约束可证明对齐,性能SOTA。
面向通用型智能体的构建式治理
提出CUGA策略系统,通过五个执行检查点嵌入治理,实现无需微调的可预测、可审计合规行为。
PlanningBench:生成可扩展且可验证的规划数据,用于评估和训练大型语言模型
提出PlanningBench框架,生成可扩展、可验证的规划数据,用于评估和训练LLM,提升其规划能力。
AutoRPA:通过LLM驱动的交互代码合成实现高效GUI自动化
AutoRPA自动将ReAct代理逻辑转为RPA函数,减少82%-96%的token消耗,兼具效率与可重用性。
评估主动对话代理中的多模态情绪识别:一项用户研究
多模态情绪识别中语言分析更可靠,用户常掩饰表情;主动代理需基于深层语言动态适应情绪演变。
迈向韧性与自治网络:AI原生的6G蓝图愿景
AI原生6G以基础模型与多智能体系统为核心,实现网络自主韧性与统一优化管理。
正视模拟与现实差距,像科学家一样思考
研究模拟与实验结合策略,提出Fisher-SEP算法分解误差与价值差距,案例验证有效性。
DeepWeb-Bench:一个要求海量跨源证据与长期推导的深度研究基准
新基准难在跨源证据收集与多步推导;检索非瓶颈(错误仅12-14%),推导与校准失误超70%,强弱模型错误模式不同。
发散诱导提示:面向零样本推理的多理由归纳
DIP框架通过生成多样理由并归纳为计划,提升零样本推理准确率,优于单策略提示。
基于网络的HIV预防干预措施:级联感知的传播抑制
针对HIV传播网络,提出CAST算法优化未抑制个体资源分配以最小化新感染级联,理论近似比2√|P|,真实网络优于基线。
通过表格网格导航和渐进推理提示的高效表格问答
提出无训练TQA方法,TGN与PIP框架提升表格问答性能,可微调小模型达大模型水平。