5455 条条目 · 106 个活跃源
2026年6月9日
04:00
arXiv cs.AI

DN-Hypo-Pipeline:一种基于大语言模型和科学解释的AI驱动假设生成工作流

提出DN-Hypo-Pipeline,利用大语言模型和科学解释生成假设,评估优于直接生成,并验证了新算法的有效性。

04:00
arXiv cs.AI

RAILS: 面向自主体商业的验证原生清算

RAILS协议为自主体商业提供验证原生清算,确保结算证据不低于义务可接受标准。

04:00
arXiv cs.AI

面向大语言模型的推理时保形推理与有效事实性控制

ITCR框架将共形预测集成推理图生成,校准阈值实现有效事实性控制与覆盖保证。

04:00
arXiv cs.AI

通过自我进化连接专家知识与自动化特征工程

FEST通过自我进化树融合专家知识与自动化特征工程,从原始文本和图像生成可审计特征,性能领先并实现专家对齐。

04:00
arXiv cs.AI

Q-Delta:超越键值关联状态演化

Q-Delta提出混合键-查询误差驱动的查询感知delta规则,提升线性注意力状态演化,在语言建模和长上下文检索中稳定优于基线。

04:00
arXiv cs.AI

推理的动量:策略优化中的密集内在信号

ISPO通过密集内在信号解决GRPO的零优势崩塌和幻觉确定性,显著提升数学推理性能。

04:00
arXiv cs.AI

STAR:将MoE路由重新构想为结构感知的子空间学习

STAR通过广义Hebbian算法学习子空间,使路由感知输入结构,实现稳定专家专业化,提升性能与鲁棒性。

04:00
arXiv cs.AI

高等教育中的混合电子评估:纸质笔试的半自动评分

提出混合电子评估方法,保留纸质笔试,通过手写识别与两遍验证实现半自动评分,提升大规模考试效度与公平性。

04:00
arXiv cs.AI

AlloSpatial:面向基础模型空间推理的智能调控框架

提出异中心空间先验与智能调控工具,提升基础模型空间推理,训练后超越更大模型。

04:00
arXiv cs.AI

FAME:面向异构时间序列预测的可预测性感知专家混合模型

提出FAME框架,通过可预测性指纹与稀疏路由实现专家选择,在工业数据集上MSE降低12.4%,将销售预测转化为数据挖掘问题。

04:00
arXiv cs.AI

环境能为自己发声吗?T²-GRPO:一种用于护理智能体的回合-轨迹组相对策略优化

提出T²-GRPO,从环境状态提取密集回合奖励,结合轨迹归一化,平衡即时反馈与长期目标,优于基线。

04:00
arXiv cs.AI

一种面向互联城市公交系统中协调中断响应的“韧性即服务”评估框架

提出KPI驱动的韧性评估框架,结合优化与模拟,多维度评估中断响应,实例验证协调策略平衡性能最优。

04:00
arXiv cs.AI

未被选取的令牌:采样、状态与AI智能体输出的可变性

AI智能体输出可变性源于令牌采样等多层次,区分内在与外在因素,影响可复现性。

04:00
arXiv cs.AI

REFLECT: 干预支持的LLM代理轨迹静默错误归因

提出REFLECT方法,通过诊断、受控重放和对比证据细化归因,在四个基准上实现最高定位精度。

04:00
arXiv cs.AI

视觉-语言模型选择的有效路由器

构建多模态数据集,提出ARMS路由,小模型经扩展训练可超越大规模模型。

04:00
arXiv cs.AI

多样的思维模式激发大型语言模型更优推理

DiScO框架通过强化学习增强思维模式多样性,提升推理能力并改善错误恢复。

04:00
arXiv cs.AI

个性化与安全相遇:个性化大语言模型中的机制、风险与缓解措施

首次全面综述个性化LLM安全风险,分析多维度漏洞与缓解策略,揭示现有研究三大缺陷。

04:00
arXiv cs.AI

基于FEA-AI混合方法的多智能体IPMSM设计优化系统

提出RAG与不确定性FEA-AI混合的多智能体系统,自动优化IPMSM设计,平衡成本与可靠性,性能优于纯FEA或AI方法。

04:00
arXiv cs.AI

LATTEArena:面向大语言模型驱动的表格特征工程评估框架(扩展版)

提出LATTEArena评估框架,含六维分类、模块化对比、多维评估及消融,揭示16项发现,推动LLM表格特征工程标准化。

04:00
arXiv cs.AI

智能体经济学:一种用于防止自主智能体中人工蜂群思维的熵控多元对齐框架

提出熵控多元对齐框架,通过三个模块防止智能体蜂群效应并增强决策透明度,提升经济系统稳健性。

04:00
arXiv cs.AI

后层融合足矣:视觉饱和下多模态大语言模型的双路径视觉令牌路由

双路径路由仅用后层融合,约3%参数即可保持多模态性能,挑战视觉令牌须遍历所有深层假设。

04:00
arXiv cs.AI

从可靠到表达:一种遵循评分标准的安全评判员课程

提出动态评分标准与渐进课程训练,使安全评判员准确稳定应对不同评分标准。

04:00
arXiv cs.AI

IMUG-Bench:在交错理解与生成任务上评估统一多模态模型的基准

提出IMUG-Bench基准,评估多轮交错图文对话的理解与生成,发现生成侧暴露偏差,探索CoT等策略提升准确性。

04:00
arXiv cs.AI

利用结构约束的扩散神经TSP求解器

PCI方法用结构感知投影替代梯度细化,在TSP上以更少推理时间取得更优最优性差距。

04:00
arXiv cs.AI

TRL-Bench:标准化跨范式的表格编码器表示级评估

TRL-Bench是标准化表格编码器跨范式表示级评估的基准,揭示编码器质量能力特定,最优管道需组合能力匹配的专家。

04:00
arXiv cs.AI

Anything2Skill:将外部知识编译为智能体的可复用技能

Anything2Skill将外部知识编译为可复用技能,结合RAG使代理成功率超94%,实现从知识访问到能力复用。

2026年6月8日
04:00
arXiv cs.AI

DiBS:扩散信息引导的分支选择

DiBS利用扩散模型引导数独求解的分支选择,降低搜索成本,保证正确性。

04:00
arXiv cs.AI

将公平性视为对称操作以检测和缓解偏差

通过正则化恢复对称性,在合成数据上减少90%偏差,准确率损失约5%,轻量通用。

04:00
arXiv cs.AI

并行连续局部搜索研究

并行CLS求解对称PB-SAT:冗余约束抑制收敛,CLS可作子求解器,局部搜索快速收敛至稳定解质量。

04:00
arXiv cs.AI

SafeGene:用于可迁移安全对齐的可重用适配器

SafeGene提出可重用安全适配器,从对齐-退化差异提取可迁移安全向量,跨任务重用,降有害响应率同时保持性能。

04:00
arXiv cs.AI

CrowdMath:众包数学研究讨论数据集

CrowdMath包含164条专家标注的协作推理进展链,评估显示模型难以识别贡献角色,暴露开放数学问题解决中的理解差距。

04:00
arXiv cs.AI

Lean4Agent:面向智能体工作流与轨迹的形式化建模与验证

Lean4Agent用Lean4形式化语言建模验证智能体工作流,验证通过者性能提升11.94%,LeanEvolve再提升7.47%。

04:00
arXiv cs.AI

CARVE-Q: 量子提议、经典认证的交互式驾驶修复

CARVE-Q利用量子搜索加速驾驶修复格查找,同时保持经典安全认证,实现可信任的量子-经典自动驾驶修复。

04:00
arXiv cs.AI

中文标题:观点:别只“事后补救”——AI科学必须研究训练动力学

中文摘要:AI科学应超越事后分析,研究训练动态以实现预测、干预和更可靠的设计。

04:00
arXiv cs.AI

代理型AI控制评估中的攻击选择显著降低安全性

攻击者策略性选择攻击时机可大幅降低安全性,现有控制评估过于乐观。

04:00
arXiv cs.AI

加速傅里叶SAT(AFSAT):全面实现基于GPU的对称伪布尔SAT求解器

AFSAT利用JAX编译器实现GPU加速伪布尔SAT求解,通过自动并行和定制离散傅里叶变换提升稳定性与效率,支持多加速器近线性扩展。

04:00
arXiv cs.AI

通过不确定性对齐的强化学习探索智能体工具调用决策

TRUST利用不确定性量化增强奖励设计,保持不确定性分离,通过关键轮次标注后训练,提升工具调用决策质量。

04:00
arXiv cs.AI

通过角度-范数分解对激活引导的几何解释

概念由角度表示,范数影响稳定性;引导方法差异源于角度与范数耦合,建议分离两类分量。

04:00
arXiv cs.AI

OpenSkill: 大型语言模型代理的开放世界自我进化

OpenSkill框架使代理在无监督下从开放世界自主构建技能与验证信号,实现高效迁移。

04:00
arXiv cs.AI

AEGIS:物理AI的应急反射

AEGIS通过轻量探针预警高风险步骤,仅在必要时切换强策略,恢复率提升5%以上,仅激活38%步数。

04:00
arXiv cs.AI

AdMem:面向任务求解智能体的高级记忆

提出整合语义、情景、程序记忆的双层框架,通过多智能体自动管理,提升LLM智能体在长程任务中的鲁棒性和成功率。

04:00
arXiv cs.AI

中文标题: 超越事后解释:基于概率中介的透明箱AI之路

中文摘要: 提出透明箱框架,用贝叶斯网络作为生成模型的事前中介,实现可审计与可争辩的推理,转向概率中介以构建可问责AI。

04:00
arXiv cs.AI

前向吸引子:修改双向搜索中的前向-前向启发式

提出前向吸引子启发式,保留信息量,成对评估减少11.2倍,节点扩展平均减少4.8倍。

04:00
arXiv cs.AI

DyCon:通过演化难度建模的动态推理控制

DyCon利用潜在步骤表示动态建模推理中的难度变化,控制推理深度,减少冗馀步骤而不损失准确性。

04:00
arXiv cs.AI

Think Fast: Estimating No-CoT Task-Completion Time Horizons of Frontier AI Models

04:00
arXiv cs.AI

TOPSIS-RAD:基于期望的排序方法

提出TOPSIS-RAD,通过决策者定义的否决与期望性能水平,剔除不可行方案并锚定理想点,避免异常值影响,确保排序稳定。

04:00
arXiv cs.AI

零样本嵌入漂移检测:针对LLM提示注入的轻量级防御

提出ZEDD框架,利用嵌入漂移检测提示注入,无需模型内部访问,准确率超93%。

04:00
arXiv cs.AI

通过局部披露对策略性主体进行离线策略评估

通过局部信息披露揭示隐藏协变量,构建双重稳健估计量,有效应对策略性行为下的离线策略评估。

04:00
arXiv cs.AI

面向上下文LLM级联的在线潘多拉魔盒

提出在线上下文潘多拉魔盒模型,用于自适应查询和选择LLM API,策略达根号T累计遗憾。

04:00
arXiv cs.AI

Act As a Real Researcher: A Suite of Benchmarks Evaluating Frontier LLMs and Agentic Harnesses in Research Lifecycle