SemPlan:面向企业数据基于大语言模型查询的结构化语义规划基准测试
双语基准含1800例,比较四类架构,正确率均低(约22-26%),A3最高但各有取舍,无统一最优。
基于缩放假设的无标签智能体学习框架能力评估
提出无标签评估学习框架法:以教师稀疏纠偏学生,用学生向教师收敛程度评分,验证其可代理无标签时真实提升。
版本更新下无通用信号可预测样本级LLM回退
无通用信号可预测LLM版本更新后的样本回退;有效性依任务而异,跨版本信号在置信度失效时仍有用。
信号时序逻辑的奖励机
基于自动机为信号时序逻辑构建马尔可夫奖励,提升强化学习策略的鲁棒性与满足率。
ARC:开放式真实世界交互中的公平相对优势比较
开放交互中行为多样使组内相对优势失真;ARC用条件化分组与混合奖励恢复公平比较,提升工具使用性能并降低首字延迟。
配对系统下覆盖感知的主动评估故障发现
结合代理与目标测试,用残差校正预测风险,支持互信息目标,发现多样严重故障,比基线多2倍。
解释多重性:电路级可解释性证据经不起合理分析变异的考验
电路级可解释性证据在合理分析变异下高度不稳定,声明翻转率73.2%,不满足合规存档标准。
FLARE MCMC:面向马尔可夫链蒙特卡洛的基于保真度的层自适应递归提议
多保真分层马尔可夫链蒙特卡洛,用低保真近似加速混合,同等计算时间内有效样本更大。
仿真驱动的车辆交通数据增强:通过虚拟感知扩展传感器覆盖
提出仿真法,用虚拟传感器替代物理传感器生成增强交通数据,保持流量特征,扩展覆盖范围。
面向能效DNN推理的内存与计算频率联合优化
本文联合优化内存、计算频率与通信资源,在截止时间约束下最小化设备能耗,提出近优闭式解与低复杂度算法,能耗最高降低10.4%。
MemoryArena上的MemoryLake:智能体记忆后端的匹配研究
比较四种记忆后端,MemoryLake在共享集成功率20.5%对13.6%领先,但样本小,结论非确定。
绝非数字:面向答案被当作事实消费的AI系统的结构性弃权
LLM文本转SQL会生成看似正确实则错误的答案,本文提出结构性弃权架构:生成外壳解释,确定性内核编译唯一可答问题,无法表达即拒绝,无需置信度估计。
HELIX:模型-框架协同进化用于递归自我改进
提出可溯源的框架进化基板,实现模型与框架协同进化:先改进固定模型,用验证轨迹更新模型,形成递归自我提升回路。
传闻时买入,新闻时卖出:消息何时被定价?
基于470万篇新闻实证:价格变动集中于发布前及当日,市场对量化新闻反应不足、对故事新闻过度反应,新闻消除不确定性。
在经典Treloar数据集上基准测试数据驱动材料模型
用Treloar经典数据基准测试六种数据驱动超弹性模型,比较精度与成本,揭示各方法优劣并公开代码。
自主芯片设计中的智能体编排
探索利用大语言模型与智能体进行芯片设计,提出将芯片设计超级智能建模为庞大AI组织。
黎曼流形上比例类比的广义平行四边形法则
在黎曼流形上引入比例类比关系,推广欧氏空间的平行四边形法则,适用于球面、形状空间及概率分布流形。
基于强化学习的生产调度:在工业涂装场景中应用数字模型游乐场
工业涂装场景下用DMPG仿真验证RL调度,PPO最稳健,弥合学术与工业差距。
FreeBalance:通过残差工作负载预测实现路由前的在线MoE负载均衡
提出FreeBalance,用残差预测提前规划专家迁移,与路由前计算重叠,隐藏同步开销,降低负载比32.8%,延迟13.1%。
传感器驱动的无人机/无人地面车辆集群任务合成:具有硬件强制安全的TB-CSPN协调架构
提出TB-CSPN架构,融合多模态传感器证据,分层协调与硬件安全包络,保障不确定环境下集群任务合成可靠且物理安全。
使用神经架构搜索设计可持续的联邦学习即服务
提出SFLaaS框架,用碳约束NAS和调度策略在硬碳限制下提升联邦训练的可行性与覆盖率,实验有效。
拨开迷雾:为LLM智能体安装与优化主动探索能力
研究LLM智能体主动探索,提出探索数据构建与对比信号RL优化两阶段方法,有效提升探索效率。
解缠共享表示提升形态-转录组整合
空间转录组多模态学习中,显式分离共享与特异信息可提升表征质量;对比学习优于VAE,解缠变体改善重建与探针指标。
用于形态学到转录组学预测的转录程序空间扩散
提出在转录程序空间中进行条件扩散生成,从组织学图像预测基因表达,利用cNMF降低维度并捕捉基因协调变异。
ScienceFlow:面向机器学习研究、科学发现等领域的长期任务智能体
ScienceFlow以可恢复状态与重锚定,在MLE-bench获70.22%奖牌率超先前4.92%
AgentRewind:面向长周期LLM智能体的可恢复执行
AgentRewind通过记录检查点实现长周期任务的回退恢复,提升成功率与进度。
绊网:通过统计认证安全神经元触发对齐拒绝
提出免训练防御,用统计认证安全神经元触发拒绝,攻击成功率≤2%,效用损失最小。
AI科学家的过去与未来
综述AI科学家:从自动化科学到集成智能体,有望变革科学,目标2050年实现诺奖级发现。
面向月球舱外活动程序指引的上下文感知AI助手与AR界面
面向月球EVA的AI助手与AR界面,通过上下文感知提供程序指导,正常工况评分10,单故障8.15,多故障性能下降。
参与式道德AI并非中立:开发者的无形之手
开发者对特征、选民、问题框架的选择影响道德AI偏好结果,投票式对齐无法靠聚合实现公平透明,需审计披露每个环节。
代理验证的LLM UX微模拟:面向早期决策支持的工件优先协议
提出工件优先的LLM UX微模拟协议,用代理语料验证模拟反馈,嵌入对齐优于词法,但重采样下不稳定。
架构师:在微软Excel中直接交互可视化深度学习数学
将Excel变为深度学习数学交互视图,实时显示前向/反向传播与参数更新,支持编辑输入超参数,并生成PyTorch代码,便于理解计算细节。
CipherSight:分布偏移下基于记录-资源语义监督的鲁棒网站指纹识别
CipherSight:基于TLS记录的分层框架,通过掩码建模与记录-资源语义监督,闭集准确率95.41%,时间/地理偏移下超90%,优于基线。
构建可靠编码智能体:评估与运维模型周边系统
提出系统级评估与运维编码智能体的框架,区分模型能力与基础设施影响,提供实践目录与协议。
音乐之镜:大语言模型作为歌曲创作中的共鸣板
AI作为诠释性共鸣板辅助创作,经校准可深化作者与素材的共振;未经校准则现谄媚漂移与过度解读风险。
AdsWorldEngine:通过编排器与工具协同进化的自进化对话广告智能体
自进化广告智能体:编排器工具协同训练,离线多样性+60%、相关性+80%,收入+22%、覆盖+74%
Act2Intention:从GUI操作推断用户意图以开发主动移动代理的基准
提出Act2Intention基准,含7.25万意图和70万动作,用于开发主动移动代理,显著提升意图理解、预测与执行性能。
考虑交通流量影响的道路养护作业优化调度
用数据驱动代理模型从OD需求直接近似均衡流量,避免重复求解,为养护调度提供可扩展方案。
基于混合大语言模型的业务流程模型安全标注自动生成框架
融合大语言模型与规则,自动生成业务流程安全标注,精度高、错误少、速度快,优于人工。
AI辅助发现并构造三块ADMM以单位阵为第三约束块时不收敛的反例
构造反例证明三块ADMM在单位阵第三块下也可能不收敛,并探讨乘子松弛恢复收敛的条件,比较不同AI工具发现路径的差异。
从风格复制到风格探索:以分析-实验-再情境化框架赋能艺术风格探索
提出AER框架通过分析实验再情境化助艺术家探索风格提升自主与反思
基于危险感知的综合包络确保城市移动中物理AI安全
提出统一框架,通过跨层安全变换将系统危险分析与运行时执行结合,确保城市移动中物理AI安全。
BGA:一种用于高熵加密流中恶意签名提取的抗噪神经蒸馏框架
抗噪蒸馏框架方差分析解耦生成对抗网络增样双向LSTM注意力提取恶意签名性能95.2%延迟毫秒级
P2Skill:面向云-本地LLM推理系统的隐私保护技能蒸馏
提出P2Skill,提示技能蒸馏,本地小模型自主分解、路由、改写、重构,免微调,隐私推理质量显著。
面向LTL指令的多任务强化学习的语义标记自动机
提出语义标记自动机任务嵌入法,支持全LTL,高效计算并提取表达性嵌入,性能达SOTA且可扩展。
校正不可见之物:多模态推理器中感知蒸馏的信用分配
提出感知校正蒸馏,以下游失败与师生分歧的乘积为门控,强化感知蒸馏,提升多模态推理基准成绩。
弥合网络碎片化:面向无人机辅助车载自组网的语义增强深度强化学习框架
提出语义增强DRL,用大模型引导探索,训练效率提升71%,连通性提升约8%,能耗降低21%。
BUZZY:用对比评分缓解多模态选择题问答中的文本诱导偏差
提出无训练解码法BUZZY,通过减去纯文本分布增强视觉信号,提升多模态选择题准确率并降低28%延迟。
NEURON:面向可落地临床可解释性的神经符号系统
NEURON融合本体知识与大模型,提升心衰预测准确率,并生成自然语言解释,优于SHAP。