基于无数据流式一致性蒸馏的实时交互式音乐生成
提出无数据流式一致性蒸馏框架,实现低延迟实时交互音乐生成,支持动态人机协作。
ODRL是什么意思?UFO-L中许可、禁止与义务的跨层次本体论基础
将ODRL基于UFO-L,提出跨层次设计原则,明确规范立场与权力结构,并机械验证公理。
无需接触无需忧:基于视觉与本体感觉的灵巧操作接触估计
提出融合视觉与本体感觉的Transformer框架,推断接触信号用于灵巧操作,经仿真与实物验证。
对智能红队的红队测试
揭示智能红队系统设计缺陷导致密钥泄露和机器控制,提出防御架构与设计原则。
中文标题:"我们人民"的可视化:通过多元数据叙事弥合认知差距
中文摘要:传统二元可视化加剧政治极化,AI支持的多元数据叙事通过展示共识与分歧,能弥合认知鸿沟,培育协作民主文化。
O-RAN中无人机轨迹优化的自适应机器学习框架
提出基于模型选择机制的持续迁移学习框架,使无人机轨迹优化收敛时间减少44%-56%。
TACTFUL:受限环境下基于触觉驱动的物体定位与识别探索
无视觉触觉探索框架,通过动态奖励策略在受限空间自主定位识别物体,成功率77%,平均重建误差0.015米。
无穷小因果性
本文提出无穷小因果性的范畴理论,将干预视为切形变,融合代数与几何Frobenius结构,统一因果充分性。
面向基于模型规划的语义潜在目标预测
LAGO框架从语言指令预测潜在子目标序列,动态分解任务,避免误差累积,实现稳健长程规划。
关于共适应神经接口中用户适应性的可辨识性
闭环编码器估计不能唯一识别用户适应,而是反映联合系统特性,需特定条件才能辨识。
PEAR:置换等变自适应路由多智能体辩论
PEAR通过动态重配置角色和稀疏拓扑,实现置换等变路由,提升多智能体辩论准确性与泛化性。
超越固定预算:表征思维树推理策略的非弹性与局限性
评估两种思维树方法,发现DPTS低预算效率差,SSDP过早停止改进,需自适应搜索策略。
AI-SDLC过程规范:一种人机边界协议语言
提出协议语言界定人机责任边界,通过结构强制约束降低系统失败率,实现AI-SDLC职责分离。
新联想主义:来自深度学习的启示
现代AI成功支持温和联想主义,监督学习为核心机制,但需复杂架构支撑。
达尔文移动智能体:自我进化路线图
提出通过去除人类先验实现自主强化学习的移动GUI智能体框架,为自我进化奠定基础。
特征相关下的人工智能辅助人类决策
特征相关时,AI辅助决策需先探索多样测试后固定,探索长度由相关度决定,计算虽难但有近似算法。
DEMM-Bench:智能体运行时治理证据充分性的跨机制基准
DEMM-Bench跨机制评估智能体决策证据充分性,发现基线过度声称,新方法准确率56.25%且无过称。
通过汉密尔顿量表示选区的优化(COTHROM):爱尔兰选举边界的算法重划
提出首个爱尔兰选举重划计算框架,用统计物理与优化方法,在科克郡测试中优于现有边界。
多目标搜索中多值启发式与降维技术的桥接
提出L-NAMOA*_dr_mvh算法,以懒惰乐观方式解决多值启发式与降维集成的正确性问题,性能提升超10倍。
面向乘客导向的自动驾驶的LLM可解释深度强化学习框架
提出LLM可解释DRL框架,实现自动驾驶自适应控制与可解释性,在安全约束下平衡性能与信任。
SPARC:面向电路问答的多智能体系统
SPARC多智能体系统通过物理仿真回答电路问题,准确率83%,较基线提升58%,支持系统化错误诊断。
学习并行字符串求解器的分割启发式策略
数据驱动自动生成分割启发式,基于特征学习选择分割原子,显著提升求解器性能。
通过智能体技术推动AI驱动的病理学研究的民主化与加速
PathLab智能体框架自动将自然语言转化为计算病理工作流,性能不输专家,大幅降低技术门槛。
自主进化训练:30B模型自主后训练
自主系统无需人工干预完成30B模型后训练,自我修正指标偏差,达到人类提交的0.87分,排位第8。
基于期望自由能的规划作为变分推理
将EFE规划视为变分自由能最小化,通过认知先验实现信息寻求,验证了可扩展性和有效性。
技能覆盖率:一种针对智能体技能的测试充分性度量
提出技能覆盖率指标,发现现有基准仅覆盖约40%技能约束,说明任务成功不代表充分测试。
代理系统中的置信度洗白:为何不确定性需要潜在载体
上游不确定性在接口丢失致下游过度自信,提出潜在不确定性作为载体保留脆弱性以提升系统可恢复性。
智能体行为挖掘:业务流程中生成式AI智能体的治理
提出智能体行为挖掘方法,将生成式AI决策转化为可观测日志,实现治理透明化,为AI业务流程提供信任基础。
量子辅助的智能体分布式AI框架:用于混合可再生能源微电网的截止时间约束编排
提出量子辅助DAI框架,用BDIx代理求解QUBO调度,结合量子/经典求解器,零截止时间错过,每日成本146.24欧元达理论最优。
从问答到任务完成:智能体系统与框架设计综述
综述智能体从问答到任务完成,分析模型-框架耦合瓶颈及工程范式演变。
中文标题
并行网络探索中代理完成仍隐藏失败,揭示三种持久模式,合成数据GRPO提升部分正确性但未消除完成-正确性差距。
重复共享访问促成顿悟,但编辑传播依赖于细粒度可寻址内存
对比四种架构发现,重复共享访问是关键,但编辑传播需细粒度可寻址内存,循环递归仅部分满足。
Fara-1.5:面向计算机使用智能体的可扩展学习环境
提出FaraGen1.5数据管道,训练Fara1.5模型系列,在浏览器基准上达到SOTA,9B模型达63.4%/86.6%。
什么塑造了突现性失调?来自训练动态、模型先验和数据的见解
研究突现性失调,发现训练损失与对齐分数相关,模型激活可预测微调后对齐分数。
内在奖励何时对代码推理有效?一项综合研究
研究显示基于确定性的内在奖励方法虽早期有效,但最终导致模型输出缩短、推理能力丧失,且预训练无显著提升。
面向长时程生物信息学工作流的过程奖励策略进化
提出过程奖励策略进化框架,利用策略库提升长时程生物信息学工作流完成度与正确性。
BioInsight:面向交互式生物医学知识发现的多智能体编排
BioInsight通过多智能体系统将静态生物医学报告转为交互式证据界面,在标准化评估中表现最优,倡导溯源交互式分析。
电力系统智能体基准:电力工程中AI智能体的可执行评估
提出首个电力工程AI智能体可执行基准,含41任务族,用确定性评估器检查可行性及违规。
基于大模型驱动的溯因推理与逻辑验证的神经符号临床试验匹配
提出αNeSy-CTM框架,结合LLM与逻辑验证,利用溯因推理提升临床试验匹配准确性与鲁棒性,相对零样本提升30%。
AutoACSL:通过整合大语言模型与基于CPG的静态分析来合成ACSL规范
AutoACSL整合LLM与CPG静态分析,自动合成ACSL规范,生成成功率98%,完整证明率96%,显著优于基线。
面向地方政府AI保障的生成式负责任AI数据评估模式(GRAIDES)
提出GRAIDES开源数据模型集中化AI可观测性,通过案例测量人机对齐与不一致,实现生成式AI系统的一致评估与保障。
智能体应如何阅读演示?层级结构优于扁平操作日志
层级子目标分组显著提升模糊任务通过率(76.7%→90.7%),建议用命名子目标组替代扁平动作日志。
智能体时间机器:未来事件预测的基础设施
提出智能体时间机器基础设施,通过重建过去网络状态评估预测代理,多智能体框架实现最佳成绩。
构建面向多模态来源的科学策展智能体框架
提出Beaver框架,通过分阶段工作流与迭代优化,实现多模态科学文献结构化策展,准确率81.0,优于前沿23点。
基于因果与构成关系的自决系统封闭
提出因果-构成循环闭合定义系统边界,满足自决且防止还原,需双过程组织。
承诺下的一致性:探究LLM逻辑推理中的泛化与空洞记忆
提出CUC评估范式,揭示LLM逻辑推理中一致性可能通过弃权空洞实现,需同时评估一致性与决断性。
重复后训练并非自我改进:诊断持续DPO流水线中的科学遗忘症
持续DPO中科学遗忘症可观测,多数策略致退化,仅保守规则调度改进,结论依赖条件。
面向构音障碍的可解释AI:基于影响的严重程度评估解释
提出基于影响的实例级解释框架,通过梯度近似识别关键样本,删除后改变预测,提供可审计解释。
机器举报:迈向深思熟虑的立场
机器举报需规范且有原则,政府应立法保护举报机器开发者。
面向超大规模数据中心AI工作负载激增的突发感知容量压力预警模型
提出面向AI负载激增的突发感知预警模型,XGBoost实现0.914召回率,支持主动容量干预。