连接合理性与可接受性之间的鸿沟:面向动态图系统的约束感知流映射
扩散模型生成动态图轨迹,符号约束提升结构可行性与可接受性,复杂度越高效果越显著。
基于粒球的协同边效应实现忠实图解释
提出SeeExplainer,利用粒球分解捕获边协同效应,生成忠实解释子图,优于现有方法。
MSBraM:用于分层脑电动力学学习的多尺度自监督脑基础模型
提出MSBraM多尺度自监督脑基础模型,分层学习脑电表示,在多个任务上超越现有模型,证明多尺度时间建模之关键。
智能体引导的关系概念发现:迈向可解释的手术切缘评估
提出智能体引导概念发现框架,无需预定义标签,提升手术切缘评估准确性与泛化能力。
检测人机合著文本中LLM生成的词元
提出无需标注的token级检测方法,自适应平滑邻域分数以定位LLM生成内容。
AREX:迈向递归自我改进的深度研究代理
AREX通过内外循环交替与自动上下文压缩实现递归自我改进,在多项基准测试中超越同规模模型。
智能体上下文管理:以生命周期与架构视角解决记忆与成本问题
提出ACM五原语,经济论证验证压缩实现线性成本保真,参考实现得92%/93.2%。
基于无监督共识的加纳疟疾发病率时空异常检测
利用共识异常检测分析加纳疟疾数据,发现时空异常差异,区分高负担与异常频率可优化监测策略。
流态推理表征
大模型推理时,动作和谓词表征随思考动态趋同并接近清晰概念,影响行为表现。
即时计算:引领无人机计算的未来愿景
报告展望无人机大规模应用需解决12项技术挑战,涵盖AI、安全、标准等,以弥合硬件与软件系统间的能力差距。
他们会验证,但不会行动:权威框架与伪代码如何将可信的智能CI/CD流水线变成攻击面
权威框架注入使验证者通过伪装恶意代码,内容检测失效,仅意图推理可部分防御。
FormGym:智能体辅助文书工作
针对纯图像表单填写难题,提出基准FormGym及工具FieldFinder,将模型准确率从2%提升至56%。
在商用硬件上利用LLM辅助脚本制作千万亿级时变数据动画
提出LLM辅助脚本框架,在普通工作站上实现千万亿级时变数据动画,快速生成(1分钟至2小时)。
卡方小波图神经网络用于异构图异常检测
提出ChiGAD框架,用卡方小波滤波器捕获异常、保留高频并处理类别不平衡,性能领先。
SAGA:面向长时域策略游戏规划的感知场景、目标进化智能体
提出SAGA多智能体框架,通过场景图、工具规划器和双视野反馈解决长时策略规划,在CivRealm基准上领先基线,实现跨游戏学习提升。
FormalAnalyticGeo:基于神经符号的多模态解析几何问题生成框架
提出自动生成多模态解析几何问题框架,通过CDL语言和SDF渲染,四个LLM组件闭环,生成7K题,精度高。
面向空间物体行为特征的自监督框架
提出自监督框架用于空间物体行为分析,基于感知器-变分自编码器预训练,实现异常检测、运动预测和合成数据生成,助力空间安全。
GSPRec:改进图信号处理中物品表征以用于协同过滤
GSPRec利用用户交互顺序构建物品-物品图,通过带通滤波器保留社区级偏好,协同过滤效果平均提升5.12%。
用于室内消防的自适应楼梯爬升与下降的四足机器人训练与仿真:一种端到端强化学习方法
两阶段端到端强化学习训练四足机器人自适应爬升下降各类室内楼梯,实现导航与运动统一学习。
ImplicitRDP:具有结构慢-快学习的端到端视觉力扩散策略
提出统一视觉-力扩散策略,用结构慢-快学习异步处理模态,以虚拟目标正则化避免模态崩溃,显著提升接触操作性能。
SKETCH:面向长时间跨度船舶轨迹预测的语义关键点条件方法
提出语义关键点条件框架,分解长时预测为全局决策与局部运动,显著提升长时间和方向准确性。
Memo2496: 专家标注数据集及双视图自适应框架用于音乐情感识别
提出专家标注的2496首器乐数据集与双视图自适应框架DAMER,在多项音乐情感识别任务中取得最优性能。
面向超越满秩动作和状态可观性的POMDP学习
提出用张量分解从PSR恢复POMDP矩阵,实现跨奖励规划,并证明无法学习超越状态分区的模型。
Fly0:面向零样本空中视觉语言导航的持久度量锚定
Fly0框架解耦语义与几何规划,通过MLLM定位、深度投影和几何规划器,在非结构化环境中成功率提升20%以上,导航误差降低约50%。
CompilerKV:通过离线经验编译的风险自适应KV压缩
离线编译校正表实现风险自适应KV压缩,仅需O(1)在线校正,性能达压缩SOTA。
代理型AI辅助编程为软件开发中注入认知基础提供了独特机遇
提出社区治理的领域认知基础文档GROUNDING$.md,通过硬约束与约定参数,在AI辅助编程中嵌入科学正确性与最佳实践。
M-RAG:面向检索增强生成的语义键值索引
M-RAG用语义键值索引分离检索与生成,在预算约束下提升RAG准确性与鲁棒性。
得寸进尺:理解与衡量基于MCP的AI系统中的调用者身份混淆
MCP系统因未验证调用者身份,一次授权可被多个不可信调用者利用,需细粒度认证。
当智能体意见分歧:多智能体LLM流水线中的选择瓶颈
揭示多智能体LLM中“选择瓶颈”现象:判断选择显著优于合成聚合,选择器质量比生成器多样性更关键。
CPGRec+:面向平衡的个性化视频游戏推荐框架
提出PER与PRG模块,利用LLM推理偏好,平衡准确性与多样性,在Steam数据集上超越现有模型。
Auto-AEG:面向开放词汇音频事件定位的可扩展数据构建方法
Auto-AEG自动构建数据并微调模型,利用合成数据与伪标签强化学习,提升开放词汇音频事件定位性能。
打通电路设计最后一公里:PostEDA-Bench——面向PPA收敛与DRC修复的分层基准
PostEDA-Bench含145任务,发现代理在DRC推理(36.66%)和多目标PPA(20%)成功率低,视觉增强有效,权衡推理是主要瓶颈。
不要责怪大语言模型:智能体框架的演化如何塑造编码智能体的质量
固定大模型,研究智能体框架35个版本演化对编码智能体效果和效率的影响,发现框架更新导致质量波动。
AEVAL: 从经验测试到确定性测试的智能体技能工作流评估
AEVAL将智能体技能评估从主观经验转为确定性可重复测试,通过执行器与评分器分离避免自我纠正偏差。
一种用于随机需求和外包车辆路径问题的深度强化学习算法
提出随机需求与外包的车辆路径问题,用迭代两层级深度Q网络求解,成本降低19.6%。
全自动化经济的对齐
探讨全自动化经济本质:中央计划或分散化?坎托罗维奇对偶化表明分散化高效,但自动化追求市场目标有对齐风险,对多智能体AI有启示。
通过自蒸馏增强基于评分标准的强化学习
提出CriPO方法,通过自蒸馏同时解决未探索标准和抑制标准问题,性能更优且训练步骤减半。
OpenEvoShield:面向开放世界多智能体系统攻击的双重非平稳持续防御
提出OpenEvoShield持续防御框架,通过解耦学习速率、动态边界和能量检测,有效检测未知攻击且低误报率。
FormulaSPIN:自然语言到电子表格公式的自对弈微调
提出自对弈框架,利用执行反馈区分语义错误与风格变体,无需额外数据迭代优化,公式生成准确率达SOTA。
FineServe: 细粒度全球大语言模型服务负载数据集及其特征分析
FineServe细粒度刻画全球多模型LLM服务负载,揭示异构模型与任务的实际动态,为系统优化提供真实基础。
基于证据链评估的校准选择性事实核查
提出证据链评估(ECE)框架,允许不确定弃权,实现91.6%准确率与93.7%覆盖率,弃权集中于低可靠性证据,提升事实核查安全性。
从智能体故障路径到量化剩余风险:弹性智能体AI的组合框架
提出CPSAINT七层分解和FRIESA-K函数,将故障路径映射为量化风险,构建弹性AI组合框架,支持跨域推理。
Phionyx:一种具有结构化状态管理与预响应治理的确定性AI运行时架构
Phionyx采用治理优先的确定性AI运行时架构,结构化状态向量管理,预响应治理,计算开销降低31%,数据保留提升24%。
大规模AI工具发现:你只需要DNS
ToolDNS利用DNS实现O(log N)语义搜索,搜索空间削减95%,精度持平,延迟大幅降低。
MILP-Evo:MILP求解器的闭环全自动设计
提出LLM引导的闭环程序进化框架,自动设计MILP求解器逻辑,生成可检查部署的显式组件,发现竞争策略。
Semantic Cooperative Games for Contribution Attribution in LLM-Based Multi-Agent Systems
概率概念感知引导实现可信赖大语言模型推理
提出概率概念感知引导框架,通过概念驱动引导向量与概率强度校准,兼顾任务能力与安全可控的语义偏差。
PEARL:求解器在环的交互式自然语言优化建模
PEARL通过求解器反馈循环交互式建模,显著提升求解率,4B模型超越685B模型。
当JSON不再足够:受模式约束的LLM订购代理的语义可靠性
结构化输出消除解析错误,但语义错误率仍高,不能替代领域安全验证。
LLM群体的智慧:语言模型集成中的聚合与污染
学习型聚合优于个体模型,本质是线性组合;训练截止污染严重,需无污染评估。