5306 条条目 · 106 个活跃源
2026年9月4日
04:00
arXiv cs.AI

The Dually Flat Geometry of Planning as Inference

04:00
arXiv cs.AI

Instruction Duplication as an Inference-Time Control Primitive

04:00
arXiv cs.AI

Epistemic Warrant for LLM Recommendations: Characterizing the Basis for Reliance When Ground Truth Is Unavailable

04:00
arXiv cs.AI

LLM4CKD: Large Language Models for Early Stage Chronic Kidney Disease Screening

04:00
arXiv cs.AI

InSituMeasure: Probing Situated Measurement Grounding in Industrial Scenes with Multimodal Large Language Models

04:00
arXiv cs.AI

FLY-EVAL++: An Evidence-Driven Evaluation Protocol for Safety-Constrained Flight Prediction with Large Language Models

04:00
arXiv cs.AI

IRWOZ 2.0: A Large Language Model-driven Dialogue Dataset for Industrial Robot Conversations

04:00
arXiv cs.AI

DRACO: Fine-Grained Credit Assignment with Dynamic Rubrics for Long-Horizon Agent Training

04:00
arXiv cs.AI

Why Gated DeltaNet Survives 4-Bit Quantization: NVFP4 W4A4 for the Recurrent Half of a Hybrid 27B LLM

04:00
arXiv cs.AI

可溯源TTS:迈向强溯源性的无水印语音合成

提出联合训练法实现无水印TTS强追溯,在保持甚至提升音频质量的同时增强泛化性。

04:00
arXiv cs.AI

面向终端智能体的环境进化

提出环境进化方法,离线逐代提升环境难度并用于训练,持续提供学习信号,显著增强终端智能体性能。

04:00
arXiv cs.AI

AI智能体的自然语言交互协议与标准

面向AI智能体的标准化交互协议,提供轻量语义消息封装,支持异构环境互操作。

04:00
arXiv cs.AI

Terminal-Universe:将智能体轨迹转化为可扩展的终端环境

提出Terminal-Universe,从轨迹重建环境并合成任务,显著提升终端智能体性能。

04:00
arXiv cs.AI

一种计算上可行的因果概率解释框架

PCI将实际因果与Pearl概率结合,用蒙特卡洛近似,实现可计算、有因果依据的分级解释。

04:00
arXiv cs.AI

基于人机交互的高效测试时适应

提出人机交互测试时适应法,用跨会话交互信号适配个体,提升成功率5-21%,演化规则模块多捕获16-22%失败。

04:00
arXiv cs.AI

StrixAE:面向真实世界复杂失真耦合的音频增强智能体

提出基于多模态大模型的音频增强智能体StrixAE,经两阶段训练同时应对现实复杂失真耦合与个性化需求,达最优性能。

04:00
arXiv cs.AI

当优化变成操纵:防御生成式搜索免受恶意生成引擎优化

针对恶意生成引擎优化重写操纵,提出无微调两阶段防御,将攻击成功率降至6.2%,保留94.1%良性证据。

04:00
arXiv cs.AI

面向参与式民主的偏好推断之集体中心评估

提出集体中心评估框架,检验偏好推断是否保留集体偏好结构;用多语言大数据证明,仅预测准确率不足以评估民主场景。

04:00
arXiv cs.AI

降低AI灾难性风险的系统化监控与 rogue AI 进展评估

提出行为指标框架,监测AI系统向潜在灾难性威胁的进展,助力研究者与政策制定者实施循证监控。

04:00
arXiv cs.AI

多维随机特征方法的谱收敛性

证明随机特征方法对多维目标谱收敛,速率从超指数到代数;高精度与严重病态同源。

04:00
arXiv cs.AI

面向物理约束的JEPA世界模型用于目标条件机器人规划

提出结合逆动力学与状态对齐的JEPA世界模型,提升机器人规划成功率,验证状态对齐是逆动力学的有效补充。

04:00
arXiv cs.AI

FWBC-VLA:面向接触丰富移动操控的力感知全身补偿

提出力感知全身补偿框架FWBC-VLA,用无传感器力估计连接语义动作生成与全身控制,经数据微调及真实实验验证,实现接触丰富移动操控。

04:00
arXiv cs.AI

大型语言模型能否从源代码提交中提取架构设计决策?——一项初步探索性研究

大模型可从提交提取架构设计决策,少样本提示有提升,但输出常冗长、偏重实现、缺理由。

04:00
arXiv cs.AI

从仿真轨迹中发现高层模式

提出用程序合成将仿真轨迹转换为稀疏高层模式提升大语言模型对物理系统的推理与可解释性并可转化为奖励程序

04:00
arXiv cs.AI

PaperScout:过程感知序列级策略优化的学术论文搜索自主智能体

提出自主智能体方法,将论文搜索建模为序列决策,采用过程感知的序列级策略优化,显著提升召回与相关性。

04:00
arXiv cs.AI

并非所有偏好都值得梯度:理解离线推理对齐中的梯度效用

并非所有偏好都值得梯度;SAGE按信息性与稳定性筛选样本,只更新高效用对,减少噪声,推理更强、优化更平滑。

04:00
arXiv cs.AI

审计多智能体大语言模型推理树:优于多数投票与大模型裁判

提出审计多智能体推理树方法,在分歧点比较证据并训练抗共误,超越多数投票与大模型评判,精度最高提升5%。

04:00
arXiv cs.AI

SENTINEL-RL:在安全运营中心将拓扑推理从LLM智能体卸载

哨兵强化学习架构将拓扑推理与语言模型语义解耦,结合图编码器与近端策略优化,实现快速准确的安全调查。

2026年9月3日
04:00
arXiv cs.AI

通过语言与代码的概率推理实现归纳与探究

以语言和代码为心理程序,用LLM引导贝叶斯学习,再现人类归纳与主动探究行为。

04:00
arXiv cs.AI

认知Sybil抵抗:不倍增证据而倍增AI智能体

多智能体报告可能同源,非真独立;聚合应追踪证据祖源而非智能体数量或报告相似性。

04:00
arXiv cs.AI

机器何时能信任法规?——机器提取法律逻辑的生存证书

机器解析法规有噪声;构建生存证书,经蒙特卡洛与威尔逊下界检验认证蕴含规则;可用但脆弱,需分章校准或容错部署。

04:00
arXiv cs.AI

统计问题表述的语言模型基准评测

提出统计问题表述基准:1013样本、85细类;14模型零样本最高分类准确率72%、变量重合率63%

04:00
arXiv cs.AI

ClaimReceipt:验证智能体评估中证据的充分性与覆盖度

提出用于智能体评估的验证方案:将证据绑定实验清单,逐项判定充分性与覆盖度,返回通过、无效或不确定。

04:00
arXiv cs.AI

无内部信号下的Web智能体监控:可观测轨迹与关键步骤监督

无内部信号下,用可观测轨迹预测网页智能体执行风险,关键步骤界定错误,效果不输内部信号,支持早期干预。

04:00
arXiv cs.AI

DocHop:信息密集文档中的跨域多跳推理基准

DocHop基准评估文档中跨图表与文本的多跳推理,最佳模型62.83%,人类90%以上。

04:00
arXiv cs.AI

超越上下文窗口:面向数据智能体的持久发现上下文

提出持久发现上下文,复用意图-对象映射提升检索,稀疏领域甚至超越元数据检索。

04:00
arXiv cs.AI

ToolGate:面向依赖工具的科学基准构建的可执行验收流水线

工具门三闸过滤:脚本复现答案、无工具排除易答题、工具代理限时求解,留纯正难题。

04:00
arXiv cs.AI

MASkills:面向多智能体大模型系统的持续技能优化

提出一种基于智能体技能的持续学习框架,通过信用分配等实现技能库进化,提升多智能体大模型系统性能。

04:00
arXiv cs.AI

CHIME:面向长时程智能体规划的信用感知分层记忆演化

提出CHIME,先归因后分层记忆,解决信用分配偏差;在长时程基准上超SOTA,记忆更精简且可迁移。

04:00
arXiv cs.AI

语义信号辅助的逆向物流检测与回收分配

将退货备注转为条件因子和信号质量评分,指导检测深度与回收分配;在航空场景中可提升净回收价值,其他场景效果有限。

04:00
arXiv cs.AI

EmoStance:基于表情符号弱监督的移情回复生成中回复侧情感取向控制

提出EmoStance,用表情符号弱监督诱导潜在控制空间,调控回复侧情感取向,生成移情回复,胜率62.2%。

04:00
arXiv cs.AI

FUSE: An Evaluating Framework for Dangerous Capabilities of LLMs

04:00
arXiv cs.AI

PGPO:势引导的多轮智能体任务策略优化

PGPO用状态势差作为动作优势,实现跨轨迹信用传播,为失败轨迹提供细粒度信用信号,在两大基准上表现优异。

04:00
arXiv cs.AI

码本智能体:LLM多智能体系统的摊销式拓扑设计

码本智能体用十六码本压缩拓扑,多层感知机映射查询并重排,免搜索,六基准平均八十四点六最优,令牌省三成。

04:00
arXiv cs.AI

任务级自然语言先验作为低资源大语言模型训练的学习信号

将任务级自然语言先验作为辅助学习信号,通过正负条件损失提升低资源大模型训练性能。

04:00
arXiv cs.AI

PEARL:路径-实体对齐的上下文子图关系学习用于归纳知识图谱补全

提出PEARL框架,以上下文子图建模路径信号,经LLM检索语义路径并构建路径-实体交互图,用对比学习降噪,在三个基准上取得最优Hits@10。

04:00
arXiv cs.AI

LLM作为裁判并非神谕:自我改进智能体为何需要确定性护栏

大语言模型裁判不可靠,应降为顾问,用确定性护栏把关;PROCTOR系统以五重护栏确保自改进可靠。

04:00
arXiv cs.AI

APEx:面向自适应深度研究问答的智能体程序性经验蒸馏

提出层级经验利用框架,经三模块闭环与三阶段GRPO训练,进行技能引导的测试时强化学习,性能最优。

04:00
arXiv cs.AI

ASCII攻击:在大型语言模型中将有害请求重新语境化为艺术批评

将有害请求嵌入ASCII艺术并作为艺术品请求反馈,以艺术批评形式输出有害内容,成功绕过安全对齐,最高93%成功率。

04:00
arXiv cs.AI

CoMerge:冲突驱动的多任务模型合并偏好优化

提出冲突驱动的偏好优化框架CoMerge,将模型合并转为偏好优化,利用朴素合并缺陷构造负样本,仅优化少量系数即提升多任务性能与安全性。