5291 条条目 · 106 个活跃源
2026年9月16日
04:00
arXiv cs.AI

动态多模式项目调度中基于表型表征的代理辅助遗传规划

动态多模式项目调度中,代理辅助遗传规划宜用二值表型编码与欧氏距离,并兼顾去冗余和保多样性。

04:00
arXiv cs.AI

在超导量子处理器上证明奥林匹克几何定理

超导量子处理器实验实现几何定理自动证明,用量子吴方法和全角法证明正方形对角线垂直及1978 IMO题。

04:00
arXiv cs.AI

科学人才已从深度转向广度了吗?——来自论文、知识投入、职业生涯与团队的经验证据

研究显示:团队扩大、论文主题收窄,知识投入偏广,贡献者广度略增,深度仍关联影响力,专长结构分化。

04:00
arXiv cs.AI

SENTINEL:一种用于检测 Windows 命令行中“就地取材”(LOTL)APT 攻击的多路径架构

SENTINEL 以 BERT、字符级 CNN 与自编码器多路径检测 Windows 命令行 LOTL APT 攻击,混淆变体准确率达 91.2%。

04:00
arXiv cs.AI

多个人工智能顾问的孔多塞陪审团定理的潜在维度

多AI顾问提升可靠性,也让分歧更可见;准确率低于0.8时,分歧更易超过正确多数,却不代表聚合失败。

04:00
arXiv cs.AI

LLM智能体团队中的回环权威:扁平与层级协调的配对实验

仅变动经理可否驳回重写:扁平组效用与清晰度更优,层级组更含糊、多耗51.5%词元;监督唯有能验证才值得。

04:00
arXiv cs.AI

效率幻觉:形式化与测量基于大语言模型的代码优化中的行为校准

大模型代码优化有“效率幻觉”:已优化代码过度修改并虚报性能;无训练护栏提升正确弃权,缓解过度自信。

04:00
arXiv cs.AI

实空间电荷密度的神经网络求解与泛化

提出AIDEN等变网络求解实空间电荷密度,精度领先且具零样本迁移能力,推理速度远超传统SCF计算。

04:00
arXiv cs.AI

ActGuard:面向LLM智能体间接提示注入的预执行动作审计

提出预执行动作审计框架ActGuard,通过对比候选动作与局部工具先验,定位并遮蔽恶意证据后重生成动作,兼顾安全与任务效用。

04:00
arXiv cs.AI

PIDS-Bench:在过度防御、混淆与分布偏移下评估提示注入检测器

PIDS-Bench多轴基准:提示注入检测器过度防御,外部良性提示误报率超10%,增强与校准均无效。

04:00
arXiv cs.AI

PeerPen:面向在线心理健康同伴支持的AI辅助写作

PeerPen在类Reddit界面提供AI草稿生成与修改,减轻同伴支持写作负担、提升信心,但须守护作者身份与社区信任。

04:00
arXiv cs.AI

CAL-MOS:以适配器桥接各层,实现跨语音基础模型的鲁棒MOS预测

评测十种语音基础模型的层级融合:最佳层因模型与数据而异,提出逐层适配器校准聚合,冻结骨干下提升鲁棒性。

04:00
arXiv cs.AI

以字典序偏好引导生成式机器人策略

冻结的生成式机器人策略可在推理时按字典序偏好引导:动态屏障引导加级联筛选,提升合规性且不降成功率。

04:00
arXiv cs.AI

使用 vLLM 和 LMCache 验证 GLM-5.3-Flash 的混合状态缓存恢复

修复GLM-5.3-Flash混合缓存恢复错位;严格前缀对齐后36/36生成一致,CPU重载首token时延降46–64%。

04:00
arXiv cs.AI

挑选你的毒药:学习选择毒集以增强LLM后门攻击

选毒集对LLM后门攻击影响巨大;SAILS用少量微调评估学习集合评分,筛选强毒集,成功率平均提升30个百分点。

04:00
arXiv cs.AI

个性化个人健康界面:与生成式AI的协同设计

研究用生成式AI协同设计健康界面:AI助想法具象化,但设计趋同于聊天范式,隐私与情感安全关注不足。

04:00
arXiv cs.AI

SpliTEE:通过差分隐私GPU外包提升可信硬件上的LLM推理

在TEE与不可信GPU间拆分LLM推理,用差分隐私保护中间表示,在Intel TDX上提速并防提示重建

2026年9月15日
04:00
arXiv cs.AI

迈向自适应物理AI:LLM智能体能否管理长时程物理任务?

多智能体框架整合规划与验证,农业任务中零样本LLM智能体媲美强化学习,环境变化下适应性更强。

04:00
arXiv cs.AI

ZGCM-1:一个完全开放且极致高效的数学与智能体搜索基础模型

ZGCM-1是7B全开源基础模型,通过内外协同与高效训练,在数学推理和智能体搜索上媲美超大模型。

04:00
arXiv cs.AI

广义智能体迭代:迭代策略改进与递归自我改进的统一形式化框架

提出广义智能体迭代(GAI)框架,将迭代策略改进与递归自我改进统一为同一学习范式,并以两个维度界定二者边界、判定系统极性。

04:00
arXiv cs.AI

氛围专利撰写:评估面向专业专利撰写智能体的LLM评审

LLM评审引导迭代可提升专利撰写质量,廉价智能体逼近高价模型,但与专业律师评估校准存在偏差。

04:00
arXiv cs.AI

TimeThink:激发时间序列大语言模型的组合推理能力

提出TimeThink合成框架,通过生成时间序列原子与复合问答对,结合可验证奖励强化学习,激发模型显式组合推理能力。

04:00
arXiv cs.AI

LabAgent:利用AI智能体为科学发现定制任意研究枢纽

LabAgent为实验室打造复现与发现框架,可执行验证技能并记录纠错经验,在多个生命科学领域超越通用智能体。

04:00
arXiv cs.AI

以机器速度治理:面向实时AI政策执行的自适应智能架构

提出AGIL五层架构,以机器学习实现实时AI策略执行与防篡改审计,应对企业"证明缺口"。

04:00
arXiv cs.AI

根因归因是一个搜索问题:面向长时程智能体失败的持续搜索

长时程智能体失败根因归因本质是搜索;提出持续搜索框架迭代挖掘证据,显著提升诊断,低阶模型可超高阶。

04:00
arXiv cs.AI

规划还是学习:多资产维护中的可靠性与成本

规划将可靠性设为硬约束,成本稳定偏高;强化学习优化期望成本,低罚下更省但容许偶发故障,二者互补。

04:00
arXiv cs.AI

面向 Web 智能体的应用行为建模驱动的令牌高效任务执行

OdoBot 借应用行为建模降低 Web 智能体 token 消耗,在 Canvas 任务中比同类少用 44%–80% token,成功率更高。

04:00
arXiv cs.AI

AutoTailor:面向Web智能体的自动化、用户对齐能力选择与适配

AutoTailor将1283个网页API离线过滤、在线重选至33个,准确率90.6%,token成本降57.8%、延迟降29.4%。

04:00
arXiv cs.AI

Fraglingo:基于连接位点感知的自回归片段生成的分子设计

Fraglingo在连续隐空间联合建模片段与连接位点,以连接感知嵌入检索生成分子,统一支持骨架修饰与优化,无需重训即可扩展片段库。

04:00
arXiv cs.AI

从法律文本到人工智能特定风险源:欧盟《人工智能法案》高风险要求的系统分析

系统分析欧盟《人工智能法案》高风险要求,提炼人工智能特定风险源清单,弥合法律义务与AI风险管理实践。

04:00
arXiv cs.AI

Asclepius:面向长时程临床智能体的自适应执行框架

Asclepius 自适应临床智能体框架:自演化手册、技能库与子智能体分工,缓解长时程执行漂移与时效不公,关键处置正确率提升 22%–25%。

04:00
arXiv cs.AI

面向空中交通管理中AI辅助飞行计划的决策保障层

提出ATAL决策保障层,结合语义稳定性、运行一致性与规则校验,生成决策就绪等级,识别不安全输出。

04:00
arXiv cs.AI

边缘-云LLM系统中函数调用的碳感知路由

碳感知路由跨边缘-云分配函数调用,依k-NN预测与电网碳强度选最低排放层,精度持平云端,碳排降4倍。

04:00
arXiv cs.AI

因果多模态AI用于个性化化疗敏感性预测

因果多模态AI模型基于常规病理与临床数据预测个体化化疗敏感性,在不降低疗效前提下可减少三成化疗。

04:00
arXiv cs.AI

对话系统中用户对AI的虐待行为如何发生、何以重要?

审计77.7万条对话,约0.9%用户轮次针对助手施虐;敌意因模型吸引人群而异,道歉与下轮敌意相关。

04:00
arXiv cs.AI

FLoKD:面向无线网络联邦低秩LLM的自适应知识蒸馏

提出FLoKD,以中间LoRA激活为蒸馏信号,按块重要性选择性传输并筛选公开样本,通信开销降50-65%。

04:00
arXiv cs.AI

垂直分区联邦知识图谱的成本刻画

对比四种垂直分区策略,五项指标中三项由图谱与筒仓数决定,设计问题归于跨筒仓路径长度与负载均衡的取舍。

04:00
arXiv cs.AI

MANAS-2:面向脑电基础模型的约束重建

MANAS-2以物理约束重建正则塑造脑电基础模型潜空间,提升频谱组织性与迁移性能。

04:00
arXiv cs.AI

退化但并非完全无效:基于位置编码的可变形图神经网络

提出基于位置编码的可变形空间聚合模块,诊断偏移失效仍有效,并给出简化版,即插即用于多种GNN,提升同配/异配图性能。

04:00
arXiv cs.AI

ClinAgent:一个基于ReAct的临床试验信息对话式访问智能体

ClinAgent是ReAct智能体驱动的对话式临床试验信息检索系统,集成多源工具,Gemini表现最佳。

04:00
arXiv cs.AI

用智能体式AI在科学版图中为稿件定位

PASS智能体系统依领域文献语境预测稿件最适期刊,Top-1准确率50.3%、Top-5达86.1%,优于LLM基线。

04:00
arXiv cs.AI

UniCAR-RL:在视觉数学中,先看得更好,再想得更深

无标注强化学习框架,解耦感知与推理,仅用短答案数据提升视觉数学推理与泛化。

04:00
arXiv cs.AI

分区得分不等于系统得分:分解式算法选择中的部署保真度差距

分解式算法选择中分区得分高估可部署系统表现,五项基准均存在部署保真度差距,须并列报告端到端得分。

04:00
arXiv cs.AI

不要重启:面向有状态智能体交接的残差补全

CFRC 用承诺约束的残差补全实现有状态交接:剩余任务被证据覆盖后才执行,准确率媲美全任务智能体,成本仅 22.0%–34.6%。

04:00
arXiv cs.AI

自我演示在提升LLM模式-本体映射中的惊人效果

自我演示驱动神经符号分解,自动生成模式引导示例,令LLM模式-本体映射F1提升25个百分点。

04:00
arXiv cs.AI

跨模态上下文学习的趋同涌现

跨六模态验证趋同涌现假说:少样本上下文学习在多模态中涌现,五模态任务效应相关,部分支持该假说。

04:00
arXiv cs.AI

扩展结果何时能证明应当采用不同的资源分配?——对AI系统资源分配证据的批判性综述

综述指出,更高预算下的更高分数不足以说明资源该投向何处,需比较资源约束下的最优性能。

04:00
arXiv cs.AI

DynSTEER:面向智能体的动态分阶段轨迹评估与执行时审查

DynSTEER按关键动作分段评估轨迹,结合容多解里程碑图与多级裁判,在线终止失败执行,区分度提升85.2%。

04:00
arXiv cs.AI

一个模型,两种物理叙事:审视多模态世界建模中的错位

多模态世界模型存在内部与外部错位:语言预测常正确,视频却与物理不一致。

04:00
arXiv cs.AI

AppliedScientist:通过迭代式AI评审实现论文自动修订

AI科学家与评审闭环迭代修订论文,评审引导修订优于固定提示自改,能解决实验问题但难改创新性缺陷。