5462 条条目 · 106 个活跃源
2026年6月2日
04:00
arXiv cs.AI

SHARP:基于睡眠的分层加速回放用于长程非平稳时间模式识别

提出SHARP框架,分离记忆与模式识别,通过离线睡眠加速回放,高效学习长程非平稳模式,在基准上提升预测性能且计算成本线性。

04:00
arXiv cs.AI

FALAT:依赖引导搜索下的LLM智能体轨迹故障溯源

提出FALAT框架,通过依赖引导搜索归因LLM智能体轨迹故障,识别责任智能体和关键步骤,在Who&When基准上优于基线。

04:00
arXiv cs.AI

潜意识学习是LoRA伪象

潜意识学习是LoRA伪象,与秩呈倒U型关系,全微调消失,依赖上下文,是脆弱的行为传输通道。

04:00
arXiv cs.AI

大型语言模型功能崩溃期间的关系性干预:一项词汇-统计消融与结构×语域因子设计

LLM功能崩溃时,关系干预导致注意力-行为分离:注意力随词汇惊奇变化,行为由结构×语域交互驱动。

04:00
arXiv cs.AI

交互中心智能:将交互作为协同创作AI与人机系统的主要分析单元

提出以交互为中心的智能框架,强调智能在交互动态中涌现,而非仅内部计算。

04:00
arXiv cs.AI

NBQ:面向动态画像的下一个最佳问题

提出NBQ框架,动态选择问题优化用户画像,配合QuickMatch加速匹配,效果显著提升。

04:00
arXiv cs.AI

基于解码器层跳过缓解大语言模型幻觉

提出DeLask框架,动态跳过易生幻觉的深层解码器层,利用梯度方向反转检测并部分聚合状态,有效缓解LLM幻觉。

04:00
arXiv cs.AI

AI评审能否改进论文撰写?——基于20篇计算机体系结构投稿的实证研究

通过20篇论文案例,AI评审覆盖大部分人工问题,还能发现遗漏,但不建议用于同行评审。

04:00
arXiv cs.AI

具有灾难状态MDP中贝尔曼最优性产生的前景理论行为

贝尔曼最优性在灾难态MDP中自然产生S形值函数、损失厌恶及政策反转,无需不对称收益。

04:00
arXiv cs.AI

通过部分信息分解理解多模态语言模型中的模态交互

引入部分信息分解框架,分离模态贡献,揭示协同与语言依赖模式,改进多模态推理性能。

04:00
arXiv cs.AI

通过苏格拉底式提问与批判性论证,向普通民众传授逻辑谬误知识,从根源遏制错误信息泛滥

用LLM结合苏格拉底提问和批判论证教普通人识别逻辑谬误,显著提升批判思维,从根源遏制误导信息传播

04:00
arXiv cs.AI

TriLens:面向白盒幻觉检测的逐层对数几率透镜熵

TriLens通过逐层读取三种模块的对数几率透镜熵,形成轨迹检测幻觉,利用内部计算过程而非最终输出。

04:00
arXiv cs.AI

TravelEval:评估基于LLM的旅行规划代理的全面基准框架

TravelEval基准以六维评估和真实数据模拟,揭示LLM在时空推理与预算合规上的不足,代理策略未稳定提升。

04:00
arXiv cs.AI

DAG-MoE:从简单混合到结构化聚合的混合专家模型

DAG-MoE用结构化聚合取代加权求和,自动学习专家聚合结构,扩展组合空间并实现单层多步推理,有效提升预训练与微调性能。

04:00
arXiv cs.AI

Before the Model Learns the Bug:Fuzzing RLVR Verifiers

04:00
arXiv cs.AI

CAREAgent:具有结构化推理和工具集成的临床智能体用于医嘱生成

提出CAREAgent,通过两阶段推理训练与多维度强化学习,在医疗基准上F1提升达5.05%。

04:00
arXiv cs.AI

RAG事实核查中LLM证据前认知状态仲裁行为诊断

引入PAVE平台评估LLM证据前认知状态与仲裁行为,发现模型依赖性强,提出JSD测试时方法提升事实可靠性。

04:00
arXiv cs.AI

推理赋能科学:将推理语言模型连接至所有科学分支

调查推理语言模型在28个科学领域的应用,提出成熟度框架,揭示学科差距与未来方向。

04:00
arXiv cs.AI

形式数学验证中生成式奖励建模的期望值对齐

提出EVA奖励建模方法,从token分布提取连续分数,用于Lean 4形式验证,减少离散化伪影,保持可解释性。

04:00
arXiv cs.AI

基于混合专家模型的动态云工作流灵活调度

DEFT首次将混合专家架构用于云工作流调度,通过图自适应门控适配不同截止日期,显著降低成本与违规。

04:00
arXiv cs.AI

算法在绿色建筑节能设计平台中的应用

结合BIM与传感器的算法平台,使绿色建筑能耗降低29.3%,成本微增3.7%,不适小时低于70小时。

04:00
arXiv cs.AI

模型科学的理由:验证、探索、引导、优化

呼吁AI社区超越基准测试,建立系统化模型分析学科“模型科学”,以验证、探索、引导、优化深入理解模型行为。

04:00
arXiv cs.AI

SIRIUS-SQL:基于执行反馈锚定多候选文本到SQL

SIRIUS-SQL通过强化学习、执行修复与混合选择,解决多候选SQL三重弱点,在BIRD和SPIDER上达75.88%和91.20%准确率。

04:00
arXiv cs.AI

基于多模态数据分析的高等数学学习行为预测与学业预警模型

通过多模态数据融合知识图谱与时序建模,精准识别高风险学生,实现个性化干预与学业风险降低。

04:00
arXiv cs.AI

智慧的形状:语言模型中的决策轨迹

答案正确性与稳定性不同,不稳定正确最多,注意力和MLP对边际影响相反。

04:00
arXiv cs.AI

潜入歧义:基于A*的多代理常识混淆攻击LLM提示

提出A*启发的事实错误诱导框架,高效生成语义对齐的混淆提示,显著提升攻击成功率。

04:00
arXiv cs.AI

科学地球:迈向行星级操作系统以支持AI原生科学发现

提出行星级科学系统Science Earth,通过EACN协议实现能力互联,实现分布式自我校正的AI原生科学发现。

04:00
arXiv cs.AI

识别你的编排器:LLM多智能体系统的熵动力学视角

熵动力学揭示多智能体系统编排器的“推理陷阱”:推理重型模型因上下文压缩而失效。

04:00
arXiv cs.AI

通过故障感知可观测性实现多智能体LLM系统中浪费计算的早期诊断

提出故障感知可观测框架,诊断多智能体LLM轨迹中浪费计算,揭示操作失败机制及资源消耗差异。

04:00
arXiv cs.AI

GuidaPA:通过联邦学习实现的公共管理隐私保护聊天机器人

GuidaPA通过联邦学习在公共文档上训练,达到接近集中式微调的问答质量,无需共享数据。

04:00
arXiv cs.AI

FlowTime: 基于流的个性化先验的连续生成式观看时长预测

提出连续生成回归范式FlowTime,采用一步生成VAE和基于流的个性化先验,解决多模态与异质性难题,性能显著优于现有方法。

04:00
arXiv cs.AI

不要依赖LLM追踪时效性: 一种确定性的记忆冲突解决方案

提出确定性聚合替代LLM判断,通过取最大序号解决记忆冲突,将单跳准确率提升至94.8%。

04:00
arXiv cs.AI

Self-Revising Discovery Systems for Science: A Categorical Framework for Agentic Artificial Intelligence

04:00
arXiv cs.AI

因果贝叶斯优化中跨干预传递信息

提出图耦合因果贝叶斯优化,共享因果参数传递干预信息,理论保证对数级信息增益和清晰误差分解,提升数据效率。

04:00
arXiv cs.AI

人工推理之谜:探究大型推理模型中的生成-评估差距

大型推理模型生成推理近乎完美,但评估时存在显著差距,根源在于答案确认偏差。

04:00
arXiv cs.AI

一种用于实时情感驱动声音化的极简脑机音乐接口:系统设计与初步评估

提出极简脑机音乐接口,将前额α不对称映射为音乐特征,实验表明该信号无法可靠区分情绪状态,个体差异影响更大。

04:00
arXiv cs.AI

TERRA:面向跨领域应用的任务嵌入推理与表示架构

TERRA提出形式化框架研究结构化状态域迁移,通过域适配器与共享核心,推导迁移误差界限及可检验假设。

04:00
arXiv cs.AI

MobEvolve:面向可解释人类移动性生成的智能体自演化启发式系统

MobEvolve是首个智能体自演化启发式框架,通过迭代演化逻辑,在轨迹保真度和分布对齐上超越现有方法,兼具可解释性和高效率。

04:00
arXiv cs.AI

用于多目标贝叶斯优化的证据门控大语言模型先验

提出证据门控机制动态校准LLM先验,多目标优化中原始置信度不可靠,门控策略提升鲁棒性。

04:00
arXiv cs.AI

TriAlign:走向个性化大语言模型对齐中的普遍真理一致性

提出TriAlign框架,用多智能体强化学习平衡普遍真理准确性、跨组一致性与个性化,减少真理差异。

04:00
arXiv cs.AI

基于踪迹驱动模拟的多模型智能体AI系统在通用任务上的表征

提出GAIATrace数据集与Vidur-Agent模拟器,揭示多模型智能体系统通用任务行为特性及设计影响。

04:00
arXiv cs.AI

TrafficRAG:一种用于交通事故责任认定的多模态RAG框架

TrafficRAG通过视觉语言模型与混合检索,融合多模态证据和法律条款,提升事故责任认定可靠性,准确率超77%。

04:00
arXiv cs.AI

并行异步自适应一阶方法的随机收敛性

提出新异步自适应一阶优化方法,非凸随机收敛达O(1/√t),适用于异构大规模ML系统。