Warrant Theory
Physics-Informed Neural Networks to Infer the Perpendicular Energy Conductivity in the Scrape-Off Layer of Stellarator Devices
ZipCodec: Ultra-Low-Frame-Rate Streaming Speech Coding
Characterizing Bluesky Content Moderation Service: From Automation of Service to Landscape of Harms
An Agentic Evaluation Framework for AI-Generated Scientific Code in PETSc
ExpTest: Loss-Curve Hypothesis Testing for Autonomous Learning-Rate Selection in Deep Neural Networks
How LLMs Follow Instructions: Skillful Coordination, Not a Universal Mechanism
VeriSim: A Configurable Framework for Stress-Testing Medical AI Under Patient Communication Noise
Relevance Is Not Permission: Localizing and Controlling Metric-Facing Attention Contributions
FastE: Readout-Triggered Token Compression for LLM Embedding Inference
GoAnt: Quality-Diversity Multi-Agent Search for Alpha Factor Discovery in Market Microstructure Data
No Screening is More Efficient with Multiple Objects
Exploring Multimodal Prompt for Visualization Authoring with Large Language Models
On the Societal Impact of Machine Learning
A Survey of Threats Against Voice Authentication and Anti-Spoofing Systems
Generalization in VAE and Diffusion Models: A Unified Information-Theoretic Analysis
Spectral Masking and Interpolation Attack (SMIA): A Black-box Adversarial Attack against Voice Authentication and Anti-Spoofing Systems
SG-Blend: Learning an Interpolation Between Improved Swish and GELU for Robust Neural Representations
Learning Intrinsic Water-Quality Dynamics with Rainfall for Data-Driven Forecasting
City Editing: Hierarchical Agentic Execution for Dependency-Aware Urban Geospatial Modification
Instance-Aware Algorithm Selection for Maximum Clique via a Dual-Channel Graph Neural Architecture
Dont Just Teach, Explain! A Gamified 20Q Recommender for Cybersecurity Education
Tactile Memory with Soft Robot: Robust Object Insertion via Masked Encoding and Soft Wrist
Builder, Defender, Breaker: Measurable Independence and Bounded Autonomy When Generative Models Build, Defend and Test Software
Omni Interaction Agent Technical Report
Hi-FLoop: Hierarchical State-Feedback Loops for Multi-Timescale World Modeling
OpenDiscoveryTrace:用于评估AI科学家工作流的流程轨迹
首个记录AI科学家完整推理过程的数据集,含558条轨迹,揭示仅看结果无法发现的行为差异。
智能体知道自己何时成功吗?从内部表征校准智能体置信度
提出LTD与ARP,从内部表征预测多轮智能体任务成功,在三个基准上超越基线,实现零开销可靠性监控。
面向北极生态导航的自主GeoAI智能体
提出人机协同多智能体GeoAI系统,融合生态与社区准则,为北极生态航行提供透明的航线决策。
子代理 vs 智能体技能:为长周期智能体任务执行可复用知识
研究表明,将技能包作为子代理调用,在长任务中优于把技能指令载入主上下文,但会增加通信开销。
通用人工智能中的自适应纠缠博弈模块
提出概率波框架,股市实证显示自适应纠缠博弈模式解释89%决策,支持LCA脑神经纠缠假说,倡导融入AGI。
状态路径工具菜单:面向在线智能体的执行先验
提出状态路径工具菜单,按执行顺序排列工具,使智能体在线任务成功率从0.737升至0.898。
Valerant:基于动作条件世界模型探索的自动可导航游戏地图生成器
免训练框架Valerant耦合动作条件世界模型与SLAM重建,从单图生成持久可导航3D游戏地图。
面向决策的主动学习用于规模感知的关键材料回收
提出决策导向主动学习,按贝叶斯风险选批次,较空间填充减少实验,并需前瞻验证放大。
XAI-Arena:LLM能否评估XAI解释的质量?
提出XAI-Arena框架,以LLM作为评判者,多维度、可复现地评估XAI解释质量,并经人类验证。
Gradland:论现象经验的多维度分化
论文以有效秩与凝聚度度量雅可比结构,在梯度世界检验梯度结构即现象经验之说,解释经验时长、质感、学习等。
从状态同步到认知自进化:认知数字孪生的可操作架构
提出四层认知数字孪生架构,构建自进化闭环,实现任务驱动的认知与决策。
面向程序性指令符合性的查询条件化执行匹配
ContractEval将程序性指令表示为查询激活义务并与响应或轨迹证据匹配,使遗漏、分支错误、顺序错误等符合性失败可被检测和定位,让程序性符合性可审计。
RobustSGPO:面向智能体框架演化的搜索空间控制
RobustSGPO控制编辑搜索空间并从快照续搜,周期权限调度提升测试分,完成率60%→80%。
智能体AI的黑盒红队测试:一种分类法驱动的自动化风险发现框架
提出黑盒红队框架,以七域分类法与SAGE-RT自动生成对抗场景,揭示智能体治理、隐私与行为风险最高达85%。
物理AI能力形成的七种来源
提出物理AI能力形成的七种来源,49条证据均可解释,达理论饱和并区分能力相似与形成相似。
可以安全停止吗?面向序贯临床诊断智能体的风险约束停止
提出风险约束停止层Cros,使序贯诊断智能体自主决定停诊,探索性验证选择性错误降至16.9%,非确证性安全认证。
情感计算的范式转移:情感共鸣、活力情感与语音交互场
主张情感分析应以语音交互场为单位,用自监督表征检测多方对话中的定向表达耦合,耦合具情境特异性。
人工智能能否通过早期网络欺凌检测支持医疗健康与心理健康?情感感知型AI对主动网络安全的影�响
提出CareGuard预警框架,融合微调模型与情感感知过滤,兼顾检测精度与效率,可支撑心理健康监测与网络安全。
SFT 究竟该学哪些 token?——数学推理的 token 裁剪视角
提出 TrimSFT,按 logit 差距重加权 SFT 损失,裁剪已掌握与低置信 token,聚焦中间区间,数学推理上稳定超越标准 SFT。
变化中的程序性记忆:受控网页任务中的复用与干扰
研究程序性记忆失配后的复用与干扰;受控实验未发现预设干扰,表明失配未必致错,但未证普遍安全。
LexAgentHallu:用于刻画法律智能体幻觉的分层基准
提出法律智能体幻觉分层基准LexAgentHallu,细粒度诊断多步轨迹幻觉,揭示“答案对推理错”效应。
Eon Era 基准:为评测 LLM 智能体打造的、具有精确真值的生成式企业系统环境
生成虚构企业基准,含产品模拟器、内部数据库与精确答案;23 家公司零合成记录,九模型准确率 42.4%–76.8%。
行为语言模型中的评分式与生成式读出:引出格式的实证研究
13个模型-领域单元中12个评分式读出排序更准,AUC高1.5–14.5点,差异源于监督与格式匹配。
RAP:研究注意力预测揭示目标条件化的证据获取偏差
提出RAP滚动基准,评估LLM研究注意力预测,揭示目标条件化证据获取偏差,微调可提升。