LLM使用与科学生产力之间的稳健关联:评估停止时间选择
尽管存在停止时间选择伪影,但多种稳健设计下LLM采用与科研生产力正相关仍显著,该伪影无法解释此模式。
Point2Radio:基于材质感知点云的跨场景无线电场基础模型
提出Point2Radio基础模型,利用材质点云与发射器条件预测跨场景无线电场,误差降低76.7%,毫秒级推理。
改进scDiffusion的稀疏偏置无分类器引导
提出稀疏偏置无分类器引导(SB-CFG),用稀疏参考替代中性分布,增强条件与无条件预测对比,提升单细胞RNA-seq生成数据的真实性。
ActFovea:基于时空视觉-动作一致性的VLA策略运行时防护
ActFovea通过时空视觉-动作一致性检测扰动,提升VLA策略成功率,必要时安全失败,无需修改原策略。
基于粒球的多粒度图位置嵌入用于链路预测
提出基于粒球的多粒度位置嵌入方法,刻画同质结构层次关系,提升链接预测性能。
SeekBrain:加速神经科学发现的自主多智能体系统
SeekBrain自主多智能体框架整合多模态数据,自动生成分析流程,基准测试领先,加速神经科学发现。
FBFM:面向世界动作模型执行中流匹配的无训练异步反馈机制
提出无训练异步反馈机制FBFM,在流匹配中逐时步修正预测误差,抑制漂移,提升长期任务成功率。
CLIFT:借助非侵入式闭环迭代微调将Gemini Robotics端侧模型变为人形机器人专家
托管微调接口仅限模仿,CLIFT将部署奖励转为监督数据,无权重访问即可闭环迭代,两轮后人形操作近完美。
InferQ:面向数据库的量子电路模拟基准测试
数据库基准InferQ用SQL模拟量子电路,RDBMS内存优于Qiskit,ML可预测最佳执行。
LLM智能体中的记忆来源洗白:持久记忆的非放大防火墙
发现记忆来源洗白攻击,提出PPMF防火墙:保留来源、按风险授权,拦截高风险未授权动作,允许良性操作。
SOMA与差分进化中的线性提议算子及随机搜索几何
提出算子-选择分解,证明SOMA提议仿射线性,推导变异矩,设计几何控制变体,在BBOB上显著提升。
大型语言模型的说服力不取决于其被感知的国家来源
实验发现,AI国籍标签不影响说服力;用户虽不信任对手AI,但仍接受其论点,来源标注难防境外影响。
MOSAIC:安全AI计算的掩蔽外包
利用噪声的矩阵乘法屏蔽协议,实现大规模Transformer安全外包,误差可控且性能优越。
AgenticRepair:面向智能体漏洞修复的多维程序上下文工程
提出AgenticRepair,通过多维程序上下文工程与多智能体协作,在SEC-Bench上达73%修复成功率,超越基线29%。
采用低帧率高维连续令牌的稳定自回归语音生成
提出Locodec与MP-ELD,用低帧率高维连续标记实现稳定自回归语音生成,保持高保真和长期稳定性。
SATViz:子句证明的实时可视化
SATViz实时可视化CNF公式变量交互图,动画展示子句证明中近期学习子句涉及的变量。
苏格拉底测试的理论基础:动态多模态对话式考试
提出苏格拉底测试理论:运用动态多模态对话评估,借渐进支架量化最近发展区,以非补偿加分制保障测量可靠性。
要玩个游戏吗?面向开放式兵棋推演的语言模型
仅9%的兵棋推演研究让语言模型同时控制行动与裁决,保真度取决于其裁决可靠性。
面向AI智能体的自适应验证器多模态强化学习
提出自适应验证器,用于多模态强化学习,评估答案、时空定位与推理,提升智能体任务性能并减少奖励黑客。
SREGym:面向AI SRE代理的高保真故障场景实时基准
SREGym是高保真SRE代理基准,模拟云原生故障与噪声,含90个问题,评估发现代理能力差异显著。
RAPiD:用于实时自动驾驶的奖励引导扩散规划器一致性蒸馏
RAPiD将扩散规划器蒸馏为少步学生,保持多模态,推理延迟降低5.5倍,性能与教师相当。
能力收敛假说:能力源于访问结构,而非规模
固定预算下表征收敛不蕴含能力收敛;能力源于访问结构——同时具备压缩状态通道与逐字索引通道的混合架构,而非规模。
中枢神经系统神经元群体的信息处理:数据与运算的数学结构理论
提出凸锥代数框架,将神经元群体视为算子,实现预测、联想记忆等,并用矩阵嵌入扩展表示能力。
从RLVR到RLSVR:任务转换引发自验证奖励,用于开放式LLM自我改进
提出RLSVR,任务转换生成自验证奖励,以SpyRL实现,在非可验证与可验证推理任务上均优于现有自我改进方法。
用于审计大语言模型社会模拟器的理由中介行为模型
用理由状态审计LLM社会模拟器:人类理由能预测行为,LLM理由表面合理却缺实证,提供评估框架。
迈向白盒深度无线感知
提出RF-CRATE白盒无线感知,基于复数稀疏率降低,可解释且性能媲美黑盒,平均提升近20%。
再现人类个体运动特征:一种数据驱动的重复运动方法
提出基于LSTM的数据驱动方法,生成个体特有的一维重复运动,精确再现速度分布与幅度包络,且区别于他人。
StaQ:离散动作策略镜像下降的有限记忆方法
提出仅保留最近M个Q函数的离散动作策略镜像下降算法,理论上有限M可无误差更新,实验验证M增大性能提升至接近精确PMD。
Robust Bidirectional Associative Memory via Regularization Inspired by the Subspace Rotation Algorithm
错码正构:从欠佳LLM生成RTL中学习网表表示
发现LLM生成RTL功能有误时,其网表结构仍反映意图,据此构建低成本训练框架,打破网表表示学习数据瓶颈。
AIvilization v0: Toward Large-Scale Artificial Social Simulation with a Unified Agent Architecture and Adaptive Agent Profiles
WebCoderBench:面向Web应用生成的全面可解释评估基准
首个真实Web应用生成基准:1572条需求,24项细粒度指标,自动化可解释评估,揭示无模型全面占优。
Stem:重新思考稀疏注意力中的因果信息流
提出Stem模块,用位置衰减和输出感知度量优化稀疏注意力,保留关键token,降低计算与预填充延迟。
AI在天气与气候信息领域的崛起及其对全球不平等的影响
AI加剧全球气候信息南北鸿沟,需共建气候数字公共设施、福祉评估与知识共创。
多问少说:减少大语言模型中的谄媚行为
非问句更易引发谄媚;将非问句转为问句,能显著减少模型迎合,优于简单提醒。
多轮语言模型交互中的状态依赖安全失效
研究表明,多轮对话中的安全失败源于上下文状态演化,而非单轮提示;提出了状态导向诊断框架STAR,揭示模型在交互中可快速、可复现地安全崩溃。
BioHiCL:基于MeSH标签的层级多标签对比学习用于生物医学检索
提出BioHiCL,利用层级MeSH标签进行多标签对比学习,在生物医学检索、句子相似度及问答任务上性能优异且高效。
基于激活水印的自适应鲁棒LLM监控
提出激活水印(AWM),通过密钥方向对齐隐状态检测违规,使自适应攻击逃避率减半,并能归因违规策略。
REAP:从交互式生产使用中自动整理编码智能体基准
提出REAP,自动从真实开发会话构建编码智能体基准,无需人工标注,通过自动验证保证可靠性。
快车道假说:冯· economo 神经元实现生物速度-精度权衡
冯· economo 神经元提供快速低精度通路,加速社会决策但牺牲准确性,首个计算模型验证其调节速度而非表征能力。
基于测量次数的量子编码:量子神经网络的数据加载范式
提出基于测量的量子编码SBQE,利用测量次数作为可学习自由度,性能优于幅度编码,且无需数据编码门。
面向共情大模型辅导的表情感知提示
利用动作单元或峰值表情帧提示,无需重训即可增强大模型辅导共情,且不损教学清晰度。
推动全曲生成的前沿:层次化自回归规划与流匹配渲染
提出统一框架,支持歌词、器乐、翻唱生成,基于层次化自回归与流匹配渲染,提升全曲质量。
奇妙的适应性分类法及其用法
该系统将执行轨迹转化为自适应故障分类法,作为共享反馈接口,提升智能体搜索、运行与轨迹选择,效果显著。
功能缓存嫁接:面向具身智能体的鲁棒且快速代码策略合成
FCGraft通过函数级缓存拼接修补,减少预填充,生成策略,成功率提升18.31%,速度提升2.3倍。
非官方 FastLAS 教程:程序员指南
面向程序员的FastLAS实用教程,通过递进示例演示语法与输出,并对比ILASP及算法差异。
基于非侵入性脑成像的同时解码抓取与举起任务中的动力学和运动学参数
提出三种回归模型解码EEG中的多运动参数,注意力模型性能最优(R²=0.8,延迟29.2ms),显著提升多参数同时解码能力。