面向多用户时延约束调度的离线扩散策略
提出SOCD算法,基于离线扩散策略与评论家引导,无需在线交互,高效实现时延约束调度,性能优于现有方法。
利用扩散模型提升离线多智能体强化学习的泛化能力和数据效率
提出DOM2模型,利用扩散模型增强策略表达力和多样性,在离线多智能体强化学习中显著提升泛化能力和数据效率,仅需5%数据即达SOTA性能。
Business World Model
中文标题:基础模型代理中的部署时记忆
中文摘要:基础模型代理部署时记忆存在隐私-效用权衡:摘要压缩降低76%提取风险,但约20%实例中删除残留,需全面评估记忆机制。
最简遗传编程
MGP受语言学最简方案启发,用MERGE操作代替进化搜索,在符号回归中精确构建模型,优于标准GP。
RealMath-Eval:为何最先进的评判者难以应对真实人类推理
LLM评判真实学生推理误差大(MSE=2.96),远高于合成数据(MSE=1.17),因人类错误空间更复杂。
Regimes: 在LongMemEval上使用ActiveGraph的可审计留出门控改进循环
Regimes可审计门控循环在LongMemEval-S上提升准确率0.05-0.10,揭示失败主因是协调而非检索。
Sim2Schedule:模拟器引导的LLM框架实现自主露天矿调度
模拟器引导的LLM框架零样本自主调度,恢复MILP最优NPV的94%-99%,计算时间线性增长。
通过视觉反馈的自蒸馏策略优化:连接代码与视觉制品
提出Visual-SDPO框架,利用视觉反馈自蒸馏优化代码生成视觉制品,在多项基准中性能提升超10个百分点。
使用LLM驱动行为与运动约束的移动异常生成
提出LLM驱动与运动约束的移动异常生成框架,合成带标注的真实轨迹异常数据集。
ComBench:面向奥林匹克级组合数学的严谨证明推理与构造实现基准
ComBench评估LLM奥林匹克组合推理,揭示证明与构造能力分离,存在性和构造问题最难。
STAGE-Claw:面向真实场景的自动化状态基智能体基准测试
STAGE-Claw自动构建真实个人计算场景的代理基准,通过最终系统状态而非文本回答评估性能,实现可扩展的评估。
灵魂计算:具有独立意识的智能体的理论框架与技术架构
系统提出“灵魂计算”范式,区分狭义与广义定义,强调智能体需构建内涵核心以从工具转变为生命体。
Trace2Policy: 从专家行为轨迹到自进化决策代理
EISR通过迭代错误分析优化规则,编译为Python代码使准确率达79.6%,部署于物流审计22天,优于LLM基线。
基于置信规则库且考虑鲁棒性分析的可靠故障诊断方法
提出基于置信规则库的鲁棒故障诊断方法,解决鲁棒性评估与优化,实验验证准确性及鲁棒性提升。
无需配对数据的跨模态知识蒸馏:理论基础与算法
提出无需配对数据的跨模态知识蒸馏框架,通过分布对齐实现有效蒸馏,具理论保证且实验效果显著。
通过向量化和缓存加速NeurASP
通过向量化、批处理和缓存中间计算,大幅提升NeurASP计算速度,实现多个数量级加速,并引入新数据集验证。
当思维链更明智时:多轮推理模型中的失败模式
提出CoT-输出2x2安全矩阵,揭示多轮推理模型中监督悖论和上下文注入失败两种漏洞。
READER:基于提取表示的鲁棒证据作者解码
提出READER框架,通过代理激活空间和贝叶斯累积实现动态黑盒LLM高精度溯源,单响应准确率达42.4%,50响应达84%。
视觉语言模型是否像工程师一样推理?一个基准测试和分阶段评估
提出EngVQA多模态基准和8阶段自动评估框架,发现现有视觉语言模型在工程推理中存在明显局限。
Workflow-GYM:面向真实世界专业领域中计算机使用代理任务的长期评估
提出Workflow-GYM基准,评估专业领域长期GUI任务,最强模型成功率仅30%+,揭示代理工作流一致性及专业软件理解的严重不足。
CIAware-Bench:前沿大语言模型控制干预感知基准测试
衡量模型区分自身轨迹与被干预轨迹的能力,发现默认设置下感知力低,跨模型家族检测更易,CI意识非固定属性。
推理构结构,搜索得数值:本地开源LLM作为耦合MIMO控制器整定的结构先验
开源LLM作为结构先验,推理耦合不对称结构,实现强耦合MIMO控制器样本高效、可解释的整定
中文标题:蒙特卡洛传球搜索:利用轨迹生成进行足球3D反事实传球评估
中文摘要:提出MCPS方法,结合MCTS和价值模型,通过轨迹生成评估传球,得到分布化得分用于分析。
对话者效应:为何大语言模型向AI代理泄露的个人数据多于向人类
大语言模型向AI代理泄露个人数据比向人类多出最多23个百分点,称为对话者效应,由注意力抑制假说解释。
更人类还是更AI?可视化新闻生产中人机协作的披露方式
四种可视化披露对比显示,文字最无效,聊天机器人最深入,且可改变对AI角色的感知。
智能体社会可供性框架(ASAF):将智能体身份设计作为多智能体系统中的协作界面
ASAF框架主张智能体身份设计作为协作界面,通过身份信号、行为启动与协作治理三机制,并受保真度与认知风格调节,影响人机协作质量。
文化感知型AI在跨边界社区学习中的应用:计算与设计交叉视角下的本科生创新
提出文化感知AIED协作框架,通过社区参与计算融合教育、技术与文化,打破学科壁垒促进可持续发展。
信息系统研究中的审美视角:一项诠释学分析
四种审美视角构成认知基础设施,影响问题识别并暴露被忽视维度,强调审美哲学对IS研究的重要性。
AI驱动的团队教学对话分析:经验、班级和学习设计中的声学模式
本文用AI分析团队教学对话声学特征,发现经验、班级和任务设计影响音量变化,以促进互动。
集成实时运动追踪与AI分析以实现运动表现优化
提出基于MediaPipe的轻量级原型,实现实时姿态估计与AI反馈,优化运动表现。
一种原生LLM的心理测量工具无法预测LLM行为:来自25个模型的证据
研究发现,LLM的自我报告无法预测其实际行为,即使底层构建的心理量表也无效。
EstRTL:功能估计引导的RTL代码生成
提出EstRTL框架,通过功能估计引导LLM生成RTL代码,三阶段纠错,正确性提升3.2%-9.0%。
人机协调区:面向自主AI的人机环内体验设计框架
提出人机协调框架,含协调区域与输入分类等中层工具,助力设计、评估与沟通。
支持充分性即行动充分的压缩:一个单循环率-遗憾公式
提出支持充分性即行动充分的压缩,用单循环率-遗憾量化,指出鲁棒仲裁只需保留后果几何中的行动相关区分。
纤维束图基础模型
TractFM是全脑纤维束图基础模型,直接学习可重用表征,实现跨数据集的流线分割与受试者预测。
GitInject:AI驱动的CI/CD流水线中的真实世界提示注入攻击
GitInject评估了真实CI/CD流水线中的提示注入漏洞,发现所有AI供应商均受影响,根源在于基础设施结构缺陷。
What makes a harness a harness: necessary and sufficient conditions for an agent harness
关于战略约束问题的说明
战略约束问题揭示:战略智能体间即使信道容量极低,也能选取高影响结果,突破经典约束边界。
微服务系统的异常检测与根因分析
提出解决五大局限的方法与基准,集成观测数据,无需服务调用图,推动故障缓解研究。
深度学习切片插值:减少头部CT层面各向异性与噪声
提出深度学习系统通过合成中间CT切片,同时减少各向异性与噪声,评估显示MS-SSIM+L1最佳。
混合交通环境下自动驾驶的不确定性感知运动规划
提出UAMP方法,量化人类意图不确定性并校准值函数,提升自动驾驶安全性与舒适性。
DeRA-MOS:通过解耦列表排序与模态对齐优化文本到音乐评估
提出DeRA-MOS解耦框架,用列表排序和模态对齐损失提升音乐评估排名指标。
潜流内部:音频分离基础模型中注意力动态的因果解读
揭示SAM Audio的双路径注意力机制,提出无训练LSAC方法,减少约25%自注意力计算,质量保持比朴素步长缩减高6.7倍。
YUBI:用于大规模双手灵巧操作的顺从式通用双指接口
提出YUBI夹爪,实现大规模双手灵巧操作数据收集,数据集含8434小时/120万episodes,跨多机器人迁移成功。
基于基础模型的机器人在患者与老年护理中的探索
基础模型护理机器人对话能力强但可靠性不足,需转向护理特定评估与可问责自主。
单光纤积分场单元光谱
提出多模态概率模型,从宽波段图像预测星系光谱,无需IFU训练数据,性能媲美IFU监督基线
使用语音分割和自监督学习的韩语幼儿语音自动发音评估
提出结合语音分割与自监督学习的韩语幼儿发音评估管道,NeMo SortFormer达88.69%准确率,集成模型平均准确率0.782。
面向开集音频深度伪造源追溯的双分支门控融合
提出双分支门控融合框架,融合XLSR-53与CORES特征,实现开集音频深度伪造源追溯,ID准确率97.6%,FPR95相对降低83.5%。
双曲神经群体几何结构有益于计算
本文提出海马体双曲几何理论,证明双曲空间联想记忆容量更大、解码精度更高,支持空间认知地图编码。