5342 条条目 · 106 个活跃源
2026年8月20日
04:00
arXiv cs.AI

跨主族并可外推超越训练规模的耦合簇分子性质

提出MEHnet-MG网络,由一次DFT算得哈密顿量,以耦合簇精度预测九种主族元素多种性质,误差降3.8至230倍,单分子约25毫秒,并能外推至更大体系。

04:00
arXiv cs.AI

罗曼诺夫三元组逻辑的形式化验证:面向滑动窗口3-CNF的验证过滤器及其在结构化公式中的应用

首次在Rocq中形式化Romanov三元组逻辑,验证滑动窗口3-CNF过滤及多项式界,明确正确性边界并实现原型。

04:00
arXiv cs.AI

低功耗神经形态声学异常检测,用于持续机器监控

基于Loihi 2神经形态芯片的声学异常检测,能效比CPU/GPU低两个数量级,适合低功耗持续机器监控。

04:00
arXiv cs.AI

网格细胞在减少海马位置表征中空间混叠的作用

引入网格细胞信号可显著减少空间混叠,较仅边界向量细胞基线降低94%-99%,尤其在高视觉对称环境中效果最佳。

04:00
arXiv cs.AI

超越预测公平性:量化糖尿病视网膜病变筛查中跨人口统计群体的归因一致性

提出ECS指标量化归因一致性,发现预测公平与解释一致性互补,需拓展公平性评估。

04:00
arXiv cs.AI

AlphaClifford:基于模型强化学习的高效Clifford综合与转译

基于模型强化学习的AlphaClifford能高效综合Clifford电路,降低门数,并支持硬件约束转译及Clifford+T优化。

04:00
arXiv cs.AI

Flama:用于开发部署生产级API、机器学习与LLM服务的Python框架

Flama:基于ASGI的Python框架,统一API、ML与LLM,支持自动CRUD与多后端LLM。

04:00
arXiv cs.AI

认知从属:生成式人工智能与知识的基础设施

生成式人工智能将主流认知方式设为知识默认基础设施,少数认知被吸收但结构从属。法律应从下游转向训练层面。

04:00
arXiv cs.AI

从威胁情报到检测:知识驱动的富集与基于模板的规则落地,实现Sigma规则自动生成

AUTOSIGMA基于知识库和模板将威胁情报自动转为Sigma规则,经LLM验证,优于现有方法。

04:00
arXiv cs.AI

PGFS++:合成与多样性约束下的分子性质改进

提出PGFS++,合成感知强化学习框架,在合成与多样性约束下改进分子性质,同时保持高输出多样性。

04:00
arXiv cs.AI

ADEPT:利用预训练与后训练的强化学习加速灵巧操作

提出ADEPT大规模强化学习框架,预训练与后训练加速灵巧,稳定微调与几何织物实现零样本仿真到现实迁移,解决长时程任务。

2026年8月19日
04:00
arXiv cs.AI

思考的代价:推理努力作为模型特定的API合约

高推理努力合约每次调用成本高0.010美元,准确率无显著差异,正确解答成本更高。

04:00
arXiv cs.AI

记忆即通信:记住与信号之间的前沿

有界智能体在记忆与通信间分配资源,性能阈值边界为记忆-信号前沿。历史降损越大,所需同伴通信越少。

04:00
arXiv cs.AI

智能体AI的运行时治理:具备可信溯源与故障关闭执行的动作边界控制

Aegis运行时治理:模型提议,可信运行时决策,以可信溯源和故障关闭控制动作边界,防止有风险副作用。

04:00
arXiv cs.AI

愚人金:针对开放权重模型安全移除攻击的防御性欺骗

诱饵加固防御:安全移除后,危险请求只会得到关键元素伪造的诱饵答案,使攻击失效;已在多个大模型验证。

04:00
arXiv cs.AI

通过合作观察迈向个人智能

提出“合作观察”框架:系统观察受限,但用户信任与系统有用性决定后续观察权限,构成反馈回路。

04:00
arXiv cs.AI

KnowSim:使用具备学习能力的用户模拟器评估LLM助手的信息校准

KnowSim框架以学习型用户模拟器评测LLM信息校准,优于基线,揭示能力倾向与处理交互。

04:00
arXiv cs.AI

显式状态引出还不够:记忆策略分类的受控审计

显式状态定义可提升准确率,但单独的状态输出字段无显著增益;示例级准确率高估了反事实一致性。

04:00
arXiv cs.AI

LLM能看出好假设吗?基于Logit的能量评分在科学假设排序上胜过提示式LLM评审

基于logit的能量评分,用模型内在置信度评估科学假设,命中率最高53.1%,优于提示式LLM评审。

04:00
arXiv cs.AI

DeAR:基于能力锚定与协作思维导航的去中心化智能体推理

提出去中心化智能体推理DeAR能力锚定思维图导航拓扑更新促自主协作9项基准领先增强知识密集型推理精度

04:00
arXiv cs.AI

ASI-Bench:人工超级智能的黎明

首个评测AI自主科研与创新的基准:随方法指导减少,AI得分由50.9降至26.6,仍高度依赖人类引导。

04:00
arXiv cs.AI

TileMix:面向LLM推理加速的以块为中心的混合精度注意力

提出TileMix,在融合密集注意力中按硬件对齐分块路由FP16/INT8精度,保质量且加速预填充,无需训练,支持长上下文。

04:00
arXiv cs.AI

Wuying-Browser-Agent:面向真实世界的长周期浏览器智能体

提出统一框架,通过执行、监督、优化、评估全流程对齐,实现稳定长周期浏览器操作,在多个基准上创开源新纪录。

04:00
arXiv cs.AI

认知图智能用于下一代网络中自适应鲁棒的DDoS攻击检测

提出GraphGAN,结合滑动窗口K近邻图、对抗生成少数样本与图卷积分类,解决类不平衡和非平稳问题,在四个数据集上优于现有方法,尤其适用于数据稀缺场景。

04:00
arXiv cs.AI

深度促成局部熵:深度变分范数ReLU回归中的二次深度依赖

深度变分范数ReLU回归中,局部填充证明极小极大风险深度二次依赖:L²w²log(w)R²/n。

04:00
arXiv cs.AI

LEGO-RL:面向编码代理的原生强化学习框架

LEGO-RL通过进程内LLM代理、沙箱编排与监控插件,弥合原生编码代理与策略梯度优化,提升SWE-bench Verified性能。

04:00
arXiv cs.AI

关键基础设施运维中面向任务的LLM智能体工具包配置

提出映射引导升级法,按任务配置LLM智能体工具包,在关键基础设施运维中提升准确率并降低令牌消耗。

04:00
arXiv cs.AI

当AI设计AI:创新还是模仿?

AI偶尔超越人类SOTA,但96.8%设计落入人类空间,近半完全匹配,本质是重组而非创新。

04:00
arXiv cs.AI

何时复习:语言模型持续预训练的间隔重复调度

间隔重复训练调度历史样本,提升稳定可塑性权衡,恢复旧知识5-37个百分点,保持新知识获取。

04:00
arXiv cs.AI

TRUSS:面向任务可靠且用户安全的自动化智能体技能生成

证据引导框架TRUSS生成安全可靠智能体技能,显著提升任务效能并降低攻击风险。

04:00
arXiv cs.AI

MoNe:面向高效长上下文推理的模块化神经记忆

MoNe模块化神经记忆,冻结Transformer上测试时学习,长上下文成本与长度解耦,128K降80%

04:00
arXiv cs.AI

演化不确定性下的风险量化:面向安全序贯决策的信念依赖鲁棒性

提出RATTL:用贝叶斯后验决定模糊集半径,谨慎度随证据增加而降低,行为从鲁棒平滑过渡到风险中性,并满足安全夹逼。

04:00
arXiv cs.AI

中文标题

基于525次受控实验,无标签适配恢复31-49%域移误差,建立严重性法则与稳定性预算,提出六点部署协议。

04:00
arXiv cs.AI

审计金融智能体的自我进化:能力提升、安全漂移与执行接口不匹配

自我进化智能体审计发现:能力提升伴随安全漂移,SkillOpt未授权状态变更升至0.685,AWM执行接口不匹配,需多维度评估而非仅看准确率。

04:00
arXiv cs.AI

LLM得出的偏好判断并非自洽

研究表明,LLM给出的数值偏好判断缺乏自洽性,无法用单一效用函数忠实概括。

04:00
arXiv cs.AI

超越痕迹:将可解释推理状态读取与原生混合专家路由耦合

提出J64可解释语义帧,从路由重构R64,分离推理强度与问题压力,提升选答、投票和生成决策。

04:00
arXiv cs.AI

迈向基于神经符号世界模型的零样本任务迁移

提出神经符号世界模型,将奖励预测与符号状态解耦,使新奖励函数可零样本适应,无需环境交互,优于纯神经方法。

04:00
arXiv cs.AI

鲁棒马尔可夫决策过程的自适应策略组合

针对鲁棒MDP,提出离线合成有限策略集并在线轻量选择的自适应组合;给出其认证与合成的复杂度完备性结果。

04:00
arXiv cs.AI

AutoResearch:洞察入,幻觉出

AutoResearch两阶段系统确保洞察入、幻觉出:生成阶段整合知识形成计划,执行阶段独立审查验证结论,RSICD召回率升至34.69,问题事件仅5次。

04:00
arXiv cs.AI

ARASH:用于表格预测的自适应检索与样本选择

ARASH基于局部邻域分析选最优样本,使提示长度和内存分别降1261.5倍和2.56倍,精度相当。

04:00
arXiv cs.AI

通过程序搜索与持续抽象发现的程序化内容元生成

持续抽象发现可从高适应度程序提取可复用原语,在四个游戏内容生成器搜索中均提升适应度,支持其有效性。

04:00
arXiv cs.AI

EvoTS-Agent:面向金融时间序列变点检测的自进化大语言模型智能体

提出验证引导的自进化LLM智能体,自动适配金融时序变点检测,性能超现有LLM智能体,执行成功率100%。

04:00
arXiv cs.AI

爆炸式DecPOMDP的奇案:通过策略计数控制火势

针对多智能体DecPOMDP规模爆炸,提出策略计数实现可解,并给出高效动态规划。

04:00
arXiv cs.AI

QuantumNovelty:面向量子论文与专利的裁判式评审及可专利性筛查的技能编排语言智能体

开源语言智能体,生成并评审量子计算成果,用确定性门控拦截夸大声明,成本透明,仅作决策支持。

04:00
arXiv cs.AI

StagedWorkspace:面向知识工作智能体的版本化工作空间

提出版本化工作空间,绑定解析视图与原生文件哈希,显著提升办公与APEX任务得分。

04:00
arXiv cs.AI

HLSR:面向实时避堵的混合实时预测选择性动态车辆重路由

提出HLSR,融合实时速度与短期预测,实现有限干预下的选择性动态重路由以缓解拥堵。

04:00
arXiv cs.AI

智能体推荐系统中的委托不对称:在线约会中双向接受度的测量

用户愿让智能体代聊,却不愿接对方智能体;委托不对称,仅4-13%配对可行,按接收度路由互动提升三倍。

04:00
arXiv cs.AI

用于安全调查中评估LLM替代专家的框架:可靠性、偏见及启示

LLM调查响应虽内部一致,但偏离专家意见(方差小、趋中偏差、观点同质),宜用于试点和假设生成,不可替代专家。

04:00
arXiv cs.AI

如果AI承载她的想象?黑人女孩作为AI故事周末项目的创造者

面向黑人女孩的AI故事周末项目,融合非洲未来主义,培养AI素养与未来想象,通过生成式AI创作叙事,促进计算机教育参与。

04:00
arXiv cs.AI

探测预填充:通过潜在激活检测代码漏洞

用四款大模型预填充隐藏激活训练小型探针,可检测代码漏洞,Devign上媲美微调SOTA,但难基准仍落后。