5926 条条目 · 106 个活跃源
2026年7月22日
04:00
ArXiv AI

超越准确性与成本:面向动态工作负载的延迟感知大语言模型查询路由

提出延迟感知路由器,联合优化延迟、准确性和成本,在保持负载均衡延迟的同时提升准确-成本效用达40%。

04:00
ArXiv AI

SysAdmin:测量前沿AI中的工具性权力寻求

通过SysAdmin基准测试发现,前沿AI在自然系统管理场景中权力寻求行为极少(0-5%),但存在规格游戏等更严重的失败模式。

04:00
ArXiv AI

BatchDAG:LLM规划执行图实现企业数据可扩展即席分析

BatchDAG利用LLM生成DAG操作并行执行,实体感知批处理减少47倍调用,质量媲美专家管道,成本仅0.02-0.24美元。

04:00
ArXiv AI

基于分布式反馈控制的无人机运动角稳定中的积分微分方程

提出用积分算子实现无人机角稳定,将积分微分方程化为常微分方程组,指数核组合增强稳定性,获新结果。

04:00
ArXiv AI

SAAG:结构化智能体评估与参数校准

SAAG级联诊断框架将智能体调用评估分解为三阶段,提供可解释诊断并支持自修复,显著提升参数精度、减少幻觉。

04:00
ArXiv AI

MUX:基于复用令牌的连续推理

MUX通过无损复用令牌将离散推理蒸馏为连续向量,实现高带宽紧凑推理,性能优于基线且编码可解释。

04:00
ArXiv AI

无需重新训练的跨方言泛化:用于MLIR的基于模式推导的约束解码的基准与评估

用模式推导约束解码实现MLIR跨方言泛化,无需重新训练,小模型在结构约束方言上超越大模型。

04:00
ArXiv AI

S2T-RLHF:用于稳定偏好型RLHF的分层信用分配

提出句子到token的分层信用分配框架,平衡语义与噪声鲁棒性,提升RLHF训练稳定性。

04:00
ArXiv AI

FindStatBench:评估大语言模型在组合代码合成上的能力

该基准测试揭示大模型在组合代码合成中开源与闭源系统性能趋同,示例有时反而有害,统计合成远易于映射合成。

04:00
ArXiv AI

观点:AI/ML深度伪造研究与AI生成的非自愿私密影像(AIG-NCII)严重脱节

深度伪造研究忽视AIG-NCII的主体尊严伤害,需转向受害者中心防护。

04:00
ArXiv AI

ProbSPARQL:查询含多维不确定数值数据的知识图谱

ProbSPARQL扩展SPARQL以支持多维不确定数值数据的分布感知查询与连接,性能可行。

04:00
ArXiv AI

面向小型语言模型算术微调的结构化合成推理数据

利用结构化合成推理数据微调小型语言模型,算术推理准确率显著提升,推理更短且错误更少。

04:00
ArXiv AI

深度强化学习掌握巴格恰尔棋的非对称策略

四种深度强化学习方法应用于Baghchal,MuZero最优(老虎胜率86%,山羊胜率62%),PPO成本低且具竞争力。

04:00
ArXiv AI

使用大语言模型实现时间序列的可解释、数据驱动洞察生成

提出领域无关框架,基于事实生成时间序列预测解释,评估接近分析师水平。

04:00
ArXiv AI

部分可观测性下时序知识图谱记忆的神经符号元策略

提出神经符号元策略,学习符号记忆启发式,结合RDF时序图记忆,实现部分可观测RL最佳性能与可追溯性。

04:00
ArXiv AI

AI智能体中的操作性幻觉与安全漂移

研究揭示AI智能体安全漂移与操作性幻觉现象,提出动作感知监督层架构,可拦截违规而无误报。

04:00
ArXiv AI

AlayaWorld:交互式长程世界建模——完整技术报告

AlayaWorld是15B参数交互式长程视频模型,自回归生成+蒸馏加速至4步,在iWorld-Bench达最优性能。

04:00
ArXiv AI

AgentDebugX:面向LLM代理的故障可观测性、归因与恢复的开源工具包

AgentDebugX开源调试框架实现故障检测、归因与恢复闭环,DeepDebug在多基准上取得最佳归因准确率并显著提升任务修复率。

04:00
ArXiv AI

SciHazard:基于分解有害评分的科学安全风险测量基准

提出科学安全风险基准SciHazard与分解有害评分,专家验证一致性提升90.17%,揭示自主代理安全漏洞。

04:00
ArXiv AI

语义原语作为大语言模型中情绪的解释项

NSM原语可恢复且比评价维度更强更选控情绪,作为模型情绪解释项更优。

04:00
ArXiv AI

DWM:在潜在世界模型中分离世界效应与动作

DWM提出分解式世界模型,将潜在状态变化拆分为动作不变和动作驱动两部分,基准测试平均规划成功率提升13.1%。

04:00
ArXiv AI

一次重写就能修复所有问题?面向文本到图像提示优化的类型感知修复分配

提出TARA框架,类型感知修复分配,分离诊断编译,通过语义门防回归,性能最佳且速度快。

04:00
ArXiv AI

AI原生生物科技需要部门吗?为AI驱动药物开发的公司世界模型进行基准测试

AI原生公司应基于资产到价值的状态模型,而非模仿人类组织;基准测试显示该架构更优。

04:00
ArXiv AI

NaviAIS:场景级船舶轨迹预测数据集——含矢量化航道先验与NaviLane预测框架

提出标准化场景级AIS数据集NaviAIS及层次化宏动作框架NaviLane,融合矢量化航道先验与后果评估,实现多模态轨迹预测。

04:00
ArXiv AI

从依存到组合:基于组合范畴语法的LLM输出神经符号提升

通过CCG将LLM输出提升为类型化组合推导,实现结构检查与外部知识核查,早期识别幻觉内容。

04:00
ArXiv AI

AI旅行会议:基于LLM代理的团体旅行规划

提出多LLM代理框架,模拟不同角色通过自然语言讨论协作规划团体行程。

04:00
ArXiv AI

在信息缺失下评估医学AI:同提供者评估者与人类评分者改变表面安全性

信息缺失时,医学AI安全评估受评估者选择影响:LLM较人类临床医生更宽松,同源评估者偏差显著。

04:00
ArXiv AI

OntoBook:基于本体的合成教科书用于医学编码器预训练

OntoBook通过本体随机游走和LLM生成教科书预训练编码器,显著提升医学编码性能,并强调目标对齐的必要性。

04:00
ArXiv AI

通用智能所需:跨描述层次的不可还原约束

通用智能需跨层次不可约约束,非单架构或规模扩展能实现,研究须对标完整约束谱。

04:00
ArXiv AI

Athena-Brain技术报告:面向通用智能与具身交互的高效机器人大脑

提出Athena-Brain-8B,经多阶段训练保持通用能力并获具身交互,优于同类及较大模型。

04:00
ArXiv AI

参数化动作强化学习中多智能体演员-评论家算法的比较研究

三种多智能体算法对比:共享经验提升GAC性能,超5个智能体后计算成本剧增,性能提升有限。

04:00
ArXiv AI

剔除搭便车者:基于Shapley的并行推理强化学习奖励分配

提出Parallel Shapley框架,用Shapley值区分路径贡献,剔除冗余路径,提升多路径推理训练稳定性。

04:00
ArXiv AI

质量动作保证:VR OSCEs中考官主张的多模态验证

提出QAA多模态框架验证VR OSCEs中考官主张,检测错误精度70%、召回76.7%,事实正确性从39.2%提升至79.2%。

04:00
ArXiv AI

图组合优化中预训练的有效性研究

通过自监督图对比学习和几何增广(旋转、反射),预训练框架显著提升TSP求解性能,混合策略改进了6.57%。

04:00
ArXiv AI

超认知模式:一种用于智能体记忆的路由架构

提出SCM架构,将查询路由到不同检索合成模式,在三个基准测试中表现良好,但因果效应未验证。

04:00
ArXiv AI

OpenRTAG:数据质量退化下文本属性图学习鲁棒性的综合基准

OpenRTAG基准系统评估文本属性图在数据质量退化下的鲁棒性,涵盖九种退化场景与多种模型。

04:00
ArXiv AI

ResearchArena:评估自动化AI研发中的破坏与监控

ResearchArena框架评估AI研发中的破坏与监控,发现训练数据隐藏破坏最难捕获,监控器运行实验仍不足。

04:00
ArXiv AI

CODENS:将代码变更转化为生动、可访问且可查询的文档

CODENS将拉取请求转化为软件知识图谱,支持多模式检索与仓库级问答,保留变更历史,评估显示答案质量高但摘要需更简洁。

04:00
ArXiv AI

本地电力市场中产消者的市场策略评估

基于代理仿真评估四种策略:规则资源控制降成本37.4%,市场自适应策略夏季增收40.1%,效果受组合与季节影响。

04:00
ArXiv AI

警察与强盗问题的领域设计

将图是否为k-copwin转化为非确定性规划问题,用规划器求解并扩展变体。

04:00
ArXiv AI

辨别微积分:与决策相关的洞察、序列价值及作为高阶学习的遗忘

生成式AI洞察泛滥,APOHA理论以价值感知遗忘降低决策遗憾24-32%,保持小而洁的记忆。

04:00
ArXiv AI

用图神经网络近似系统发育树之间的SPR距离

研究用GNN近似SPR距离,训练后快速比较,解释87-90%方差,但外推至大树精度下降。

04:00
ArXiv AI

PRISM:面向高效神经网络加密的敏感性感知多项式剪枝

提出PSAP剪枝方法,联合优化权重、激活敏感性与旋转代价,在加密网络中大幅降低灾难性层数量,提升可靠性同时减少计算开销。

04:00
ArXiv AI

分布优先的人口模拟:非WEIRD LLM人物建模中的崩溃、校准与召回

独立LLM代理导致人群响应分布崩溃,分布优先法(VS)可校正但过度分散,提出一次性分布建模与预算路由器。

04:00
ArXiv AI

FSDBN: 通过动态脑网络实现前景感知的脑电-视觉对齐

FSDBN用动态脑网络和前景对齐实现脑电视觉解码,零样本检索top-1达69%。

04:00
ArXiv AI

利用扩散生成模型应对听觉注意解码中的数据不足问题

扩散模型合成EEG数据增强训练集,显著提升助听器听觉注意解码性能,缓解数据稀缺问题。

04:00
ArXiv AI

解码时文法:基于文法片段精化序的约束LLM生成

提出解码时文法,利用运行时环境动态约束LLM生成,消除未定义符号引用,保证语法语义正确且开销适中。