5298 条条目 · 106 个活跃源
2026年9月12日
04:00
arXiv cs.AI

Warrant Theory

04:00
arXiv cs.AI

Physics-Informed Neural Networks to Infer the Perpendicular Energy Conductivity in the Scrape-Off Layer of Stellarator Devices

04:00
arXiv cs.AI

ZipCodec: Ultra-Low-Frame-Rate Streaming Speech Coding

04:00
arXiv cs.AI

Characterizing Bluesky Content Moderation Service: From Automation of Service to Landscape of Harms

04:00
arXiv cs.AI

An Agentic Evaluation Framework for AI-Generated Scientific Code in PETSc

04:00
arXiv cs.AI

ExpTest: Loss-Curve Hypothesis Testing for Autonomous Learning-Rate Selection in Deep Neural Networks

04:00
arXiv cs.AI

How LLMs Follow Instructions: Skillful Coordination, Not a Universal Mechanism

04:00
arXiv cs.AI

VeriSim: A Configurable Framework for Stress-Testing Medical AI Under Patient Communication Noise

04:00
arXiv cs.AI

Relevance Is Not Permission: Localizing and Controlling Metric-Facing Attention Contributions

04:00
arXiv cs.AI

FastE: Readout-Triggered Token Compression for LLM Embedding Inference

04:00
arXiv cs.AI

GoAnt: Quality-Diversity Multi-Agent Search for Alpha Factor Discovery in Market Microstructure Data

04:00
arXiv cs.AI

No Screening is More Efficient with Multiple Objects

04:00
arXiv cs.AI

Exploring Multimodal Prompt for Visualization Authoring with Large Language Models

04:00
arXiv cs.AI

On the Societal Impact of Machine Learning

04:00
arXiv cs.AI

A Survey of Threats Against Voice Authentication and Anti-Spoofing Systems

04:00
arXiv cs.AI

Generalization in VAE and Diffusion Models: A Unified Information-Theoretic Analysis

04:00
arXiv cs.AI

Spectral Masking and Interpolation Attack (SMIA): A Black-box Adversarial Attack against Voice Authentication and Anti-Spoofing Systems

04:00
arXiv cs.AI

SG-Blend: Learning an Interpolation Between Improved Swish and GELU for Robust Neural Representations

04:00
arXiv cs.AI

Learning Intrinsic Water-Quality Dynamics with Rainfall for Data-Driven Forecasting

2026年9月10日
04:00
arXiv cs.AI

OpenDiscoveryTrace:用于评估AI科学家工作流的流程轨迹

首个记录AI科学家完整推理过程的数据集,含558条轨迹,揭示仅看结果无法发现的行为差异。

04:00
arXiv cs.AI

智能体知道自己何时成功吗?从内部表征校准智能体置信度

提出LTD与ARP,从内部表征预测多轮智能体任务成功,在三个基准上超越基线,实现零开销可靠性监控。

04:00
arXiv cs.AI

面向北极生态导航的自主GeoAI智能体

提出人机协同多智能体GeoAI系统,融合生态与社区准则,为北极生态航行提供透明的航线决策。

04:00
arXiv cs.AI

子代理 vs 智能体技能:为长周期智能体任务执行可复用知识

研究表明,将技能包作为子代理调用,在长任务中优于把技能指令载入主上下文,但会增加通信开销。

04:00
arXiv cs.AI

通用人工智能中的自适应纠缠博弈模块

提出概率波框架,股市实证显示自适应纠缠博弈模式解释89%决策,支持LCA脑神经纠缠假说,倡导融入AGI。

04:00
arXiv cs.AI

状态路径工具菜单:面向在线智能体的执行先验

提出状态路径工具菜单,按执行顺序排列工具,使智能体在线任务成功率从0.737升至0.898。

04:00
arXiv cs.AI

Valerant:基于动作条件世界模型探索的自动可导航游戏地图生成器

免训练框架Valerant耦合动作条件世界模型与SLAM重建,从单图生成持久可导航3D游戏地图。

04:00
arXiv cs.AI

面向决策的主动学习用于规模感知的关键材料回收

提出决策导向主动学习,按贝叶斯风险选批次,较空间填充减少实验,并需前瞻验证放大。

04:00
arXiv cs.AI

XAI-Arena:LLM能否评估XAI解释的质量?

提出XAI-Arena框架,以LLM作为评判者,多维度、可复现地评估XAI解释质量,并经人类验证。

04:00
arXiv cs.AI

Gradland:论现象经验的多维度分化

论文以有效秩与凝聚度度量雅可比结构,在梯度世界检验梯度结构即现象经验之说,解释经验时长、质感、学习等。

04:00
arXiv cs.AI

从状态同步到认知自进化:认知数字孪生的可操作架构

提出四层认知数字孪生架构,构建自进化闭环,实现任务驱动的认知与决策。

04:00
arXiv cs.AI

面向程序性指令符合性的查询条件化执行匹配

ContractEval将程序性指令表示为查询激活义务并与响应或轨迹证据匹配,使遗漏、分支错误、顺序错误等符合性失败可被检测和定位,让程序性符合性可审计。

04:00
arXiv cs.AI

RobustSGPO:面向智能体框架演化的搜索空间控制

RobustSGPO控制编辑搜索空间并从快照续搜,周期权限调度提升测试分,完成率60%→80%。

04:00
arXiv cs.AI

智能体AI的黑盒红队测试:一种分类法驱动的自动化风险发现框架

提出黑盒红队框架,以七域分类法与SAGE-RT自动生成对抗场景,揭示智能体治理、隐私与行为风险最高达85%。

04:00
arXiv cs.AI

物理AI能力形成的七种来源

提出物理AI能力形成的七种来源,49条证据均可解释,达理论饱和并区分能力相似与形成相似。

04:00
arXiv cs.AI

可以安全停止吗?面向序贯临床诊断智能体的风险约束停止

提出风险约束停止层Cros,使序贯诊断智能体自主决定停诊,探索性验证选择性错误降至16.9%,非确证性安全认证。

04:00
arXiv cs.AI

情感计算的范式转移:情感共鸣、活力情感与语音交互场

主张情感分析应以语音交互场为单位,用自监督表征检测多方对话中的定向表达耦合,耦合具情境特异性。

04:00
arXiv cs.AI

人工智能能否通过早期网络欺凌检测支持医疗健康与心理健康?情感感知型AI对主动网络安全的影�响

提出CareGuard预警框架,融合微调模型与情感感知过滤,兼顾检测精度与效率,可支撑心理健康监测与网络安全。

04:00
arXiv cs.AI

SFT 究竟该学哪些 token?——数学推理的 token 裁剪视角

提出 TrimSFT,按 logit 差距重加权 SFT 损失,裁剪已掌握与低置信 token,聚焦中间区间,数学推理上稳定超越标准 SFT。

04:00
arXiv cs.AI

变化中的程序性记忆:受控网页任务中的复用与干扰

研究程序性记忆失配后的复用与干扰;受控实验未发现预设干扰,表明失配未必致错,但未证普遍安全。

04:00
arXiv cs.AI

LexAgentHallu:用于刻画法律智能体幻觉的分层基准

提出法律智能体幻觉分层基准LexAgentHallu,细粒度诊断多步轨迹幻觉,揭示“答案对推理错”效应。

04:00
arXiv cs.AI

Eon Era 基准:为评测 LLM 智能体打造的、具有精确真值的生成式企业系统环境

生成虚构企业基准,含产品模拟器、内部数据库与精确答案;23 家公司零合成记录,九模型准确率 42.4%–76.8%。

04:00
arXiv cs.AI

行为语言模型中的评分式与生成式读出:引出格式的实证研究

13个模型-领域单元中12个评分式读出排序更准,AUC高1.5–14.5点,差异源于监督与格式匹配。

04:00
arXiv cs.AI

RAP:研究注意力预测揭示目标条件化的证据获取偏差

提出RAP滚动基准,评估LLM研究注意力预测,揭示目标条件化证据获取偏差,微调可提升。