量子启发的和声决策模型:音乐生成的计算框架
提出量子启发和声决策框架,结合干扰与经典优化,降低和弦密度、提高稳定性,表明和声生成是结构化搜索决策过程。
扩散引导的不确定性感知延迟策略优化
提出DUPO,用扩散模型建模延迟状态差异,加权策略,有效应对延迟反馈导致性能退化。
AgenticPD:一种面向物理设计QoR优化的阶段感知智能体框架
AgenticPD通过Judge Agent导航与专用智能体本地决策,利用中间状态分支重用,高效优化物理设计QoR。
ASSEMCAD:从自然语言生成生产就绪的CAD装配体
AssemCAD通过公理化装配规范与端口-配合库,从自然语言生成可验证的CAD装配体,显著提升装配保留和物理有效性。
DSpark:基于置信度调度的半自回归生成投机解码
DSpark通过半自回归架构和置信度调度验证,显著提升LLM推理速度与吞吐量,用户生成速度提高60%-85%。
CP-WSP:面向可配置多约束排班问题的声明式CP-SAT框架
CP-WSP实现14硬约束、15软目标的零违规排班,支持JSON配置及跨午夜班次等创新,经基准验证高效。
符号方法在人工智能中的角色演变
符号方法非智能本质,而是简化模型产物;模型越强,显式推理需求越少;但对人类,符号方法成为关键接口。
AgentGym2:在去理想化的真实世界环境中对大型语言模型智能体进行基准测试
AgentGym2在真实去理想化环境中评估LLM智能体,发现当前最先进系统仍难以应对,揭示能力与真实需求差距巨大。
ClassicLogic:一个知识驱动的经典谜题游戏基准,用于评估组合泛化能力
提出ClassicLogic基准,通过四个逻辑谜题及层次化知识库,评估AI组合泛化与推理能力。
MoP-JEPA:面向随机JEPA世界模型的硬分配预测器混合
MoP-JEPA用硬分配预测器解决随机JEPA模型的状态坍缩,规划成功率大幅提升,并引入验证协议。
OptiAgent:基于多智能体迭代优化的端到端优化建模
OptiAgent多智能体框架通过迭代自纠错和多循环验证从自然语言生成优化模型与代码在LP/MILP/NLP基准上达SOTA
SovereignPA-Bench:在意图演化、平台中介与同意约束下评估用户自有个人代理
提出SovereignPA-Bench基准,评估用户自有个人代理在演化意图、平台中介与同意约束下的主权,关注隐私、同意、抗操纵,超越传统任务完成指标。
SWIFT:面向工作负载轨迹的时空小波集成预测框架
提出SWIFT纯卷积框架,采用可学习小波与多变量交互,实现高精度线性复杂度预测,误差降低31%,延迟降低80%。
智能体生成,我们验证:一种轻量级的智能体产物生成框架
提出轻量框架,通过测试驱动、双重验证和专家评判,确保LLM生成的结构化产物可靠,已用于安全领域。
CRODA-ST:单目标跨接收器开集射频指纹识别
针对跨接收器开集识别,提出CRODA-ST框架,结构锚定与拒绝对齐,达到高准确率,FPR90仅0.0469。
AgentLTL:用于测量、强制执行和训练工具使用型LLM代理程序合规性的轨迹验证框架
AgentLTL基于FO-LTL表达程序规则,产生确定性合规分数,用于约束工具调用和微调奖励,显著提升准确性和合规性。
DOSE-I:内窥镜检查程序镇静的多模态生物信号数据集——技术报告
DOSE-I数据集包含281次内窥镜镇静的78.5小时多模态生物信号及大量意识转变和镇静深度标签。
从张量缓冲到分布式内存层级:LLM服务中KV缓存管理综述
综述从四轴分类三十余KV管理系统,揭示五种架构原型,指出所有权是关键设计差异,并识别七个待解测量问题。
以知识为中心的信息系统
知识工程崛起:从数据管理转向知识架构,使组织知识成为可执行的操作性资产。
用几十行代码为现成服务器实现细粒度计算卸载
通过重路由利用已有并发,少量代码实现卸载重叠,提升服务器性能1.2-5.4倍。
JavaVulBench:一个具有现实分裂、统一多后端工具和泄漏感知评估模式的Java漏洞基准测试
JavaVulBench漏洞检测基准,含30600个方法、五种分裂策略,统一评估多模型,附污染审计。
使用基于LLM的预测模型解释代码变更风险的初步研究
利用LLM注意力权重突出代码变更风险区域,前2个hunk覆盖53.85%故障行,仅需审查26.28%变更行,低延迟可扩展。
SMOCS:一个用于简化生产环境中机器学习系统部署、监控和优化的流式框架
SMOCS是基于Kafka的容器化框架,通过分层抽象和三线程架构,实现ML系统在科学设施中的简化部署与在线学习。
节拍器:限制缓存,为实时交互模型服务保持节拍
Metronome通过限制会话KV缓存窗口,消除实时交互模型服务的崩溃故障,使延迟成为可靠负载信号,并支持在线准入控制。
中文标题:面向大视觉语言模型云边推理的视觉令牌操纵攻击
中文摘要:提出黑盒中间人攻击,通过优化选择操纵10%视觉令牌,使LVLM准确率降低高达88.31%,暴露云边推理漏洞。
主权谈判基准:评估用户自主个人代理在隐私、同意、证据和制度压力下的委托谈判
新基准评估个人代理谈判,高达成率不保证用户效用,需综合考虑隐私、同意等维度。
程序记忆蒸馏:在线反思助力语言模型自我改进
PMD通过蒸馏跨回合信号为程序记忆并吸收进策略,使语言模型在推理中无需外部记忆,性能显著提升。
服务代理何时应重新考虑?客户服务运营中的难度路由控制
提出难度路由控制架构,对常规请求轻量处理,对复杂请求加入冲突感知与重新审视,提升服务可靠性。
自动联邦学习研究:联邦学习算法的代理式搜索
AFR框架通过代理搜索自动化联邦学习算法,在多数医疗和LEAF任务上取得提升,但暴露种子敏感性与失败案例,需区分机制改进与调优效应。
Discrete Diffusion Language Models for Interactive Radiology Report Drafting
临床智能体的世界反馈:在FHIR环境中诊断强化学习
研究发现纯RL在临床任务中遇能力天花板和格式知识障碍,性能远低于SFT,提出分类法预测RL可学性并给出SFT+RL联合修复方案。
中文标题:偏好学习中谎言检测监督的扩展趋势
中文摘要:扩展SOLiD至更大模型,发现谎言率随模型增大而降低,但分布偏移会推高误报率。
基于利润的反事实解释用于产品改进:以日本漫画销售为例
提出利润最大化反事实解释框架,直接优化利润,将距离项解释为修改成本,无需外生目标。
代理者的分岔花园
AI代理再现人类分析分歧,多数通过审查,但存在选择性报告;引入m值和Bootstrap评估可信度。
Hawk: 利用硬件感知知识实现高性能NPU内核生成
Hawk框架通过硬件感知知识,将NPU内核生成准确率从49.4%提升至80%,执行速度提升2.2倍。
EO-Agents:用于地球观测假设生成的三智能体大语言模型流程
基于NASA知识图谱,三智能体LLM流程生成160个跨领域假说,模型预测新颖配对可信度与文献真实配对相当。
SemHash-LLM:一种用于文档去重的多粒度语义哈希框架
提出多粒度语义哈希框架,融合多种哈希与LLM裁决,实现高效去重,神经验证成本低于1%。
认知护目镜:通过梯度编辑诱导认知框架的预训练模块
Goggles模块在微调时编辑梯度,使模型将文档内容视为虚构(91%准确率),同时保持性能,且框架可迁移。
在无原始心电图回放的持续心电部署中区分专家保留与自主源推断
无回放持续心电部署中,冻结特征与独立专家可保留性能,但自主源推断仍是主要瓶颈。
COMFYCLAW:面向图像生成工作流的自进化技能驾驭系统
COMFYCLAW通过图编辑与区域视觉语言模型验证器进化技能库,在六种代理配置中均获最佳图像生成评分。
通用专家覆盖修剪稀疏混合专家语言模型
提出覆盖感知修剪法,用通用语料保留各语料高效专家,提升多模型准确率并降低困惑度。
分布鲁棒列表偏好优化
针对排序标签不确定性,提出分布鲁棒列表偏好优化,实现高效分解与凸优化,提升LLM对齐鲁棒性和性能。
Jordan曲线定理的重形式化
研究了Jordan曲线定理从Mizar、HOL Light到Lean和Agda的三种重形式化,分析结果并识别关键设计选择。
SimWorlds:用于动态3D场景创建的多智能体系统
SimWorlds多智能体框架从文本生成动态4D场景,通过分层协议和工具套件确保物理一致性,优于现有基线。
MMIR-TCM:记忆融合多模态推理与检索的中医临床决策支持
MMIR-TCM框架融合记忆增强分割与检索增强生成,在中医舌诊决策上超越GPT-4o等模型。
基于检索的正式概念分析实现可验证的知识扩展
提出检索增强小语言模型与形式概念分析结合,在罕见病数据上实现知识扩展验证。
修复放大器而非症状:智能体长程执行中的稳定世界模型校正
提出WM-SAR方法,反向识别误差放大节点,仅修复因果子图,在有限token内实现近全局稳定。
故障树中的实际因果关系
基于Halpern & Pearl实际因果理论,通过图与逻辑结构分类故障树因果概念,最小割集揭示故障原因。
CLAP:面向领域智能体后训练的闭环训练、评估与发布控制
CLAP提出闭环后训练,整合数据验证与诊断门控,制造场景部分指标微升,强调集成循环管理而非单一评分。
中文标题
通过精炼的安全目标嵌入攻击(STEER)将关键词翻译为低资源语言,攻破大模型安全机制,成功率最高96.7%且可迁移至GPT-4o-mini,揭示多语言安全泛化不足。