5419 条条目 · 106 个活跃源
2026年7月3日
04:00
arXiv cs.AI

通过LF-IBIS的全贝叶斯强化学习

提出LF-IBIS算法,结合ABC与IBIS实现无似然函数的全贝叶斯强化学习,在线更新信念并量化策略不确定性。

04:00
arXiv cs.AI

Pmeta-TLA:基于元学习和音色泄露攻击的语音分类模型后门攻击

提出Pmeta-TLA多后门攻击,利用元学习和音色泄露,实现高效、隐蔽且鲁棒的语音分类后门攻击。

04:00
arXiv cs.AI

MedStreamBench:一个面向流式与主动式医疗视频理解的时间感知基准

MedStreamBench是首个评估医疗视频回答时机的基准,实验显示模型在流式和主动场景下性能显著下降。

04:00
arXiv cs.AI

SAB-LVLM:面向大型视觉-语言模型的显著性感知二值化

提出显著性感知二值化方法SAB-LVLM,通过Hessian矩阵和空间显著性图识别跨模态权重重要性,实现约1比特压缩下性能领先。

04:00
arXiv cs.AI

轻量级安全强化学习用于端到端无人机导航

提出安全约束的轻量强化学习框架,结合安全PPO和课程学习,实现高效安全的无人机导航。

04:00
arXiv cs.AI

混合并行策略:面向专家混合模型的高效内存训练栈

MoP混合并行训练栈在12节点H200上高效训练万亿参数百万上下文,吞吐量比FSDP2提升4.7-8.2倍。

04:00
arXiv cs.AI

关于代码仓库中LLM生成代码与注释的探索性研究

研究发现LLM生成代码随时间减少,多出现于测试用例且存在大量克隆;公司仓库比例更高,但仅少数bug与之相关。

04:00
arXiv cs.AI

这个检查点被去拒了吗?一项双信号审计及其失效图谱

提出双信号审计法,结合激活拒绝差与权重恢复能量,高效检测被移除拒绝机制的检查点,并映射两种失败模式。

2026年7月2日
04:00
arXiv cs.AI

支持航路空中交通管制的解空间路径规划

针对航路空中交通管制,提出可解释、高效的解空间路径规划算法,SSPPV配合区域冲突检测可达平均3.69毫秒。

04:00
arXiv cs.AI

建设性对齐:在人类-AI互动中引导偏好动态变化

AI对齐旨在引导人类偏好演化,而非静态满足,通过控制价值轨迹确保其连贯、自主、理性且抗操纵。

04:00
arXiv cs.AI

Seed2.0模型卡:面向现实复杂性的智能前沿

Seed2.0模型系列构建评估系统,攻克长尾知识与复杂指令跟随,具备领先推理、视觉与搜索能力,初步处理现实复杂任务。

04:00
arXiv cs.AI

有限道德:界定道德计算的空间

提出有限道德框架,从广度和深度分析道德计算,资源限制下伦理理论为局部策略,定义道德遗憾与进步。

04:00
arXiv cs.AI

MMM数据模型——可去中心化知识共同体中知识互操作性的规范说明

MMM数据模型结合规范约束与自由文本标签,实现跨学科知识互操作,无需语义收敛,具备可行性和可用性。

04:00
arXiv cs.AI

让失败变得安全:一个用于开放网络数据收集的约束性、可验证智能体框架

提出约束可验证智能体框架,通过类型化JSON配置和静态执行,实现零LLM开销的可复用、确定性数据收集。

04:00
arXiv cs.AI

中文标题:具有双向信息不对称的上下文赌博机监督博弈

中文摘要:研究双向信息不对称下的人机监督博弈,给出团队最优与近视规则的差距,揭示可避免伤害区间与不可信沟通代价。

04:00
arXiv cs.AI

构建认知AI素养:检测学生与AI协同编程中的认知目标与过程

认知AI素养框架揭示学生-AI协同编程中78.8%互动缺乏认知目标,仅11.1%有高认知参与。

04:00
arXiv cs.AI

从信号到结构:记忆架构如何驱动LLM智能体中的语言涌现

LLM智能体在信号游戏中,记忆架构比通道容量更关键,带笔记本可稳定协调达0.867,无状态智能体则随容量增大退化。

04:00
arXiv cs.AI

运行时管理自主:基于齿轮的单/多智能体信息物理系统安全与治理

提出五档执行齿轮系统,实现单/多智能体CPS安全与治理,异常检测99.6%,延迟降低3.5倍。

04:00
arXiv cs.AI

Mnemosyne:用于验证和修复AI生成工作流的智能体事务处理

提出ATP事务模型,将AI生成动作视为不可信提议,经约束集验证后才提交,实现安全修复且开销低于6%。

04:00
arXiv cs.AI

中文标题:演化环境中具身智能体的多尺度世界模型混合

中文摘要:MuSix框架通过尺度感知路由与演化机制,解决专家混合在具身智能中的尺度缺失和更新不均问题,显著提升多尺度推理与动态适应能力。

04:00
arXiv cs.AI

PHREEQC-MCQ-200:面向工具增强型科学模拟器代理的诊断基准

提出PHREEQC-MCQ-200基准,评估工具增强科学模拟代理,发现工具提升准确率但非单调,输出协议影响性能,需端到端诊断。

04:00
arXiv cs.AI

AI原生游戏:综述与路线图

本文定义AI原生游戏为核心循环依赖生成式AI,提出G/N双轴分类法,分析53款游戏,指出语义开放性是关键设计问题。

04:00
arXiv cs.AI

HARC:耦合有害性和拒绝方向实现鲁棒安全对齐

HARC微调方法耦合提示与响应位置的有害性和拒绝方向,实现强鲁棒安全对齐且不损通用能力。

04:00
arXiv cs.AI

面向代理式RAG流水线的贝叶斯不确定性传播:多跳问答的概念验证研究

提出贝叶斯不确定性传播用于代理式RAG,多跳问答评估显示HotpotQA更有效,StrategyQA暴露上游信号不可靠问题。

04:00
arXiv cs.AI

可验证规则的智能体生成:确定性自扩展反应分类

多智能体LLM自动生成可验证反应规则,将分类从68类扩至14073类,分类率达97.7%,实现自扩展符号系统。

04:00
arXiv cs.AI

自主实验室编排器的最优资源利用

两步法:约束规划优化调度,状态依赖稳健执行,实现资源最优利用。

04:00
arXiv cs.AI

从“字符串”到“事物”:面向个人知识图谱的LLM三元组抽取在推荐系统中的评估

提出用轻量LLM从对话数据提取用户偏好三元组构建个人知识图谱,评估发现部分模型抽取与下游推荐性能俱佳。

04:00
arXiv cs.AI

UltraFlux: 数据-模型协同设计,实现跨多种宽高比的高质量原生4K文本到图像生成

UltraFlux通过数据-模型协同设计,结合共振2D RoPE、VAE后训练、SNR感知Huber小波损失和阶段式美学课程学习,实现稳定保细节的4K文生图,超越开源模型并媲美Seedream 4.0。

04:00
arXiv cs.AI

拓扑空洞分析:知识空间系统性技术创新发现的数学框架

TVA框架通过三元组条件识别知识空洞,在约14万文档中生成2128候选,端到端通过率0.05%,发现非明显技术连接。

04:00
arXiv cs.AI

无基质的人格:体制依赖性与大语言模型个体化问题

四个实验揭示跨体制共指假设错误,提出载体与体制对作为身份单元。

04:00
arXiv cs.AI

面向具身智能的内存原生非地面网络

提出MemNTN范式,利用长期上下文优化系统,双内存架构,在卫星具身问答中表现优越。

04:00
arXiv cs.AI

PRA-RAG: 面向检索增强生成中对抗检索污染的可证明鲁棒聚合

提出PRA-RAG可证明鲁棒聚合算法,防御检索污染,攻击成功率降至1%,准确率71%。

04:00
arXiv cs.AI

SkillSelect-Serve:面向小型LLM智能体的预算可控且QoS感知的技能服务推荐与组合

提出预算可控、QoS感知的SkillSelect-Serve框架,通过双粒度效用建模提升技能服务推荐组合的召回与效用。

04:00
arXiv cs.AI

GRACE-RAG: 受控检索架构用于规范证据合成,实现闭域机构轻量部署

GRACE-RAG通过图增强检索外化结构推理,避免碎片化证据,轻量部署于闭域机构,质量提升20%。

04:00
arXiv cs.AI

利用稀疏自编码器将句子嵌入与人类概念对齐

提出用稀疏自编码器解耦句子嵌入为可解释概念,激活引导干预检索,实现透明可控的神经信息检索。

04:00
arXiv cs.AI

比较大型语言模型在Scrum认证问题上的表现:准确性、稳定性和错误模式

评估三个LLM在Scrum认证问题上的表现,Gemini准确性最高,错误呈现系统性模式。

04:00
arXiv cs.AI

基于人类演示的接触力引导的灵巧操作学习

提出CHORD框架,用物体中心接触力引导强化学习,在4739个任务中成功率达82.12%,可迁移到真实世界。

04:00
arXiv cs.AI

就Scrum认证问题提示GPT-5:一项实证准确性研究

GPT-5回答Scrum认证问题准确率超85%,引用提示最佳达89.1%,错误集中于范围外和过时解读。

04:00
arXiv cs.AI

AGE:面向图检索增强生成的图嵌入自适应掩码

AGE采用掩码自监督学习对齐图文特征,聚焦非关键节点预测,提升图问答任务精度。

04:00
arXiv cs.AI

SWE-Router:多轮自主软件工程任务中的路由选择

SWE-Router利用部分轨迹决策路由,提升任务成本效率并保持强模型性能。

04:00
arXiv cs.AI

用于RIS辅助跟踪与功率控制的主动感知:一种混合神经进化与监督学习方法

提出混合神经进化与监督学习的双代理主动感知框架,在RIS辅助跟踪和功率控制中精度与鲁棒性超越传统滤波与机器学习方法。

04:00
arXiv cs.AI

AlgoBench:代码生成中算法适应性的基准测试

AlgoBench通过约束变换生成新算法问题,用复杂度指标测试模型算法适应能力,发现模型表现大幅下降,错误主因是算法而非实现。

04:00
arXiv cs.AI

土耳其语和阿拉伯语中的仇恨言论检测:一项综合研究

提出含土耳其语5类及阿拉伯语1类话题的仇恨言论数据集,并开发基于BERT的多维度仇恨分析模型。

04:00
arXiv cs.AI

SLIM-RL:基于风险预算的随机掩码强化学习,用于扩散大语言模型且无需轨迹切片

SLIM-RL通过风险预算解码器控制提交风险,采用无迹随机掩码目标,在更少训练样本下超越现有方法。

04:00
arXiv cs.AI

SEFORA:学生论文与反馈语料库及大语言模型反馈评估框架

SEFORA包含564篇论文和8240条教师反馈,UniMatch评估框架显示LLM生成反馈F1低于0.4,难以匹配教师重点。

04:00
arXiv cs.AI

基于大语言模型的意图驱动网络拓扑设计框架

提出LLM框架,通过约束管道从自然语言生成合规且弹性的网络拓扑,评估结构与弹性,为AI网络设计提供基准。

04:00
arXiv cs.AI

统一引导框架增强流匹配,实现高效鲁棒语音合成

统一引导框架通过数据增强与模型优化,加速流匹配推理近3倍,提升语音合成效率与鲁棒性。

04:00
arXiv cs.AI

隐藏因素至关重要:利用视觉语言模型识别规划关键的被遮挡对象

引入PKL度量,VLM识别关键遮挡,微调小模型性能提升30%,实现高效风险评估。

04:00
arXiv cs.AI

当AI遇见量子信息:综合评述

AI与量子信息双向赋能:AI助力量子系统学习与设计,量子信息提升AI性能,但面临可重现性、可扩展性等挑战。

04:00
arXiv cs.AI

DiscoLoop:循环离散嵌入与连续隐状态实现多跳推理

混合离散与连续通道的循环架构,解决多跳推理中表示对齐问题,实现近完美准确率。