动态多模式项目调度中基于表型表征的代理辅助遗传规划
动态多模式项目调度中,代理辅助遗传规划宜用二值表型编码与欧氏距离,并兼顾去冗余和保多样性。
在超导量子处理器上证明奥林匹克几何定理
超导量子处理器实验实现几何定理自动证明,用量子吴方法和全角法证明正方形对角线垂直及1978 IMO题。
科学人才已从深度转向广度了吗?——来自论文、知识投入、职业生涯与团队的经验证据
研究显示:团队扩大、论文主题收窄,知识投入偏广,贡献者广度略增,深度仍关联影响力,专长结构分化。
SENTINEL:一种用于检测 Windows 命令行中“就地取材”(LOTL)APT 攻击的多路径架构
SENTINEL 以 BERT、字符级 CNN 与自编码器多路径检测 Windows 命令行 LOTL APT 攻击,混淆变体准确率达 91.2%。
多个人工智能顾问的孔多塞陪审团定理的潜在维度
多AI顾问提升可靠性,也让分歧更可见;准确率低于0.8时,分歧更易超过正确多数,却不代表聚合失败。
LLM智能体团队中的回环权威:扁平与层级协调的配对实验
仅变动经理可否驳回重写:扁平组效用与清晰度更优,层级组更含糊、多耗51.5%词元;监督唯有能验证才值得。
效率幻觉:形式化与测量基于大语言模型的代码优化中的行为校准
大模型代码优化有“效率幻觉”:已优化代码过度修改并虚报性能;无训练护栏提升正确弃权,缓解过度自信。
实空间电荷密度的神经网络求解与泛化
提出AIDEN等变网络求解实空间电荷密度,精度领先且具零样本迁移能力,推理速度远超传统SCF计算。
ActGuard:面向LLM智能体间接提示注入的预执行动作审计
提出预执行动作审计框架ActGuard,通过对比候选动作与局部工具先验,定位并遮蔽恶意证据后重生成动作,兼顾安全与任务效用。
PIDS-Bench:在过度防御、混淆与分布偏移下评估提示注入检测器
PIDS-Bench多轴基准:提示注入检测器过度防御,外部良性提示误报率超10%,增强与校准均无效。
PeerPen:面向在线心理健康同伴支持的AI辅助写作
PeerPen在类Reddit界面提供AI草稿生成与修改,减轻同伴支持写作负担、提升信心,但须守护作者身份与社区信任。
CAL-MOS:以适配器桥接各层,实现跨语音基础模型的鲁棒MOS预测
评测十种语音基础模型的层级融合:最佳层因模型与数据而异,提出逐层适配器校准聚合,冻结骨干下提升鲁棒性。
以字典序偏好引导生成式机器人策略
冻结的生成式机器人策略可在推理时按字典序偏好引导:动态屏障引导加级联筛选,提升合规性且不降成功率。
使用 vLLM 和 LMCache 验证 GLM-5.3-Flash 的混合状态缓存恢复
修复GLM-5.3-Flash混合缓存恢复错位;严格前缀对齐后36/36生成一致,CPU重载首token时延降46–64%。
挑选你的毒药:学习选择毒集以增强LLM后门攻击
选毒集对LLM后门攻击影响巨大;SAILS用少量微调评估学习集合评分,筛选强毒集,成功率平均提升30个百分点。
个性化个人健康界面:与生成式AI的协同设计
研究用生成式AI协同设计健康界面:AI助想法具象化,但设计趋同于聊天范式,隐私与情感安全关注不足。
SpliTEE:通过差分隐私GPU外包提升可信硬件上的LLM推理
在TEE与不可信GPU间拆分LLM推理,用差分隐私保护中间表示,在Intel TDX上提速并防提示重建
迈向自适应物理AI:LLM智能体能否管理长时程物理任务?
多智能体框架整合规划与验证,农业任务中零样本LLM智能体媲美强化学习,环境变化下适应性更强。
ZGCM-1:一个完全开放且极致高效的数学与智能体搜索基础模型
ZGCM-1是7B全开源基础模型,通过内外协同与高效训练,在数学推理和智能体搜索上媲美超大模型。
广义智能体迭代:迭代策略改进与递归自我改进的统一形式化框架
提出广义智能体迭代(GAI)框架,将迭代策略改进与递归自我改进统一为同一学习范式,并以两个维度界定二者边界、判定系统极性。
氛围专利撰写:评估面向专业专利撰写智能体的LLM评审
LLM评审引导迭代可提升专利撰写质量,廉价智能体逼近高价模型,但与专业律师评估校准存在偏差。
TimeThink:激发时间序列大语言模型的组合推理能力
提出TimeThink合成框架,通过生成时间序列原子与复合问答对,结合可验证奖励强化学习,激发模型显式组合推理能力。
LabAgent:利用AI智能体为科学发现定制任意研究枢纽
LabAgent为实验室打造复现与发现框架,可执行验证技能并记录纠错经验,在多个生命科学领域超越通用智能体。
以机器速度治理:面向实时AI政策执行的自适应智能架构
提出AGIL五层架构,以机器学习实现实时AI策略执行与防篡改审计,应对企业"证明缺口"。
根因归因是一个搜索问题:面向长时程智能体失败的持续搜索
长时程智能体失败根因归因本质是搜索;提出持续搜索框架迭代挖掘证据,显著提升诊断,低阶模型可超高阶。
规划还是学习:多资产维护中的可靠性与成本
规划将可靠性设为硬约束,成本稳定偏高;强化学习优化期望成本,低罚下更省但容许偶发故障,二者互补。
面向 Web 智能体的应用行为建模驱动的令牌高效任务执行
OdoBot 借应用行为建模降低 Web 智能体 token 消耗,在 Canvas 任务中比同类少用 44%–80% token,成功率更高。
AutoTailor:面向Web智能体的自动化、用户对齐能力选择与适配
AutoTailor将1283个网页API离线过滤、在线重选至33个,准确率90.6%,token成本降57.8%、延迟降29.4%。
Fraglingo:基于连接位点感知的自回归片段生成的分子设计
Fraglingo在连续隐空间联合建模片段与连接位点,以连接感知嵌入检索生成分子,统一支持骨架修饰与优化,无需重训即可扩展片段库。
从法律文本到人工智能特定风险源:欧盟《人工智能法案》高风险要求的系统分析
系统分析欧盟《人工智能法案》高风险要求,提炼人工智能特定风险源清单,弥合法律义务与AI风险管理实践。
Asclepius:面向长时程临床智能体的自适应执行框架
Asclepius 自适应临床智能体框架:自演化手册、技能库与子智能体分工,缓解长时程执行漂移与时效不公,关键处置正确率提升 22%–25%。
面向空中交通管理中AI辅助飞行计划的决策保障层
提出ATAL决策保障层,结合语义稳定性、运行一致性与规则校验,生成决策就绪等级,识别不安全输出。
边缘-云LLM系统中函数调用的碳感知路由
碳感知路由跨边缘-云分配函数调用,依k-NN预测与电网碳强度选最低排放层,精度持平云端,碳排降4倍。
因果多模态AI用于个性化化疗敏感性预测
因果多模态AI模型基于常规病理与临床数据预测个体化化疗敏感性,在不降低疗效前提下可减少三成化疗。
对话系统中用户对AI的虐待行为如何发生、何以重要?
审计77.7万条对话,约0.9%用户轮次针对助手施虐;敌意因模型吸引人群而异,道歉与下轮敌意相关。
FLoKD:面向无线网络联邦低秩LLM的自适应知识蒸馏
提出FLoKD,以中间LoRA激活为蒸馏信号,按块重要性选择性传输并筛选公开样本,通信开销降50-65%。
垂直分区联邦知识图谱的成本刻画
对比四种垂直分区策略,五项指标中三项由图谱与筒仓数决定,设计问题归于跨筒仓路径长度与负载均衡的取舍。
MANAS-2:面向脑电基础模型的约束重建
MANAS-2以物理约束重建正则塑造脑电基础模型潜空间,提升频谱组织性与迁移性能。
退化但并非完全无效:基于位置编码的可变形图神经网络
提出基于位置编码的可变形空间聚合模块,诊断偏移失效仍有效,并给出简化版,即插即用于多种GNN,提升同配/异配图性能。
ClinAgent:一个基于ReAct的临床试验信息对话式访问智能体
ClinAgent是ReAct智能体驱动的对话式临床试验信息检索系统,集成多源工具,Gemini表现最佳。
用智能体式AI在科学版图中为稿件定位
PASS智能体系统依领域文献语境预测稿件最适期刊,Top-1准确率50.3%、Top-5达86.1%,优于LLM基线。
UniCAR-RL:在视觉数学中,先看得更好,再想得更深
无标注强化学习框架,解耦感知与推理,仅用短答案数据提升视觉数学推理与泛化。
分区得分不等于系统得分:分解式算法选择中的部署保真度差距
分解式算法选择中分区得分高估可部署系统表现,五项基准均存在部署保真度差距,须并列报告端到端得分。
不要重启:面向有状态智能体交接的残差补全
CFRC 用承诺约束的残差补全实现有状态交接:剩余任务被证据覆盖后才执行,准确率媲美全任务智能体,成本仅 22.0%–34.6%。
自我演示在提升LLM模式-本体映射中的惊人效果
自我演示驱动神经符号分解,自动生成模式引导示例,令LLM模式-本体映射F1提升25个百分点。
跨模态上下文学习的趋同涌现
跨六模态验证趋同涌现假说:少样本上下文学习在多模态中涌现,五模态任务效应相关,部分支持该假说。
扩展结果何时能证明应当采用不同的资源分配?——对AI系统资源分配证据的批判性综述
综述指出,更高预算下的更高分数不足以说明资源该投向何处,需比较资源约束下的最优性能。
DynSTEER:面向智能体的动态分阶段轨迹评估与执行时审查
DynSTEER按关键动作分段评估轨迹,结合容多解里程碑图与多级裁判,在线终止失败执行,区分度提升85.2%。
一个模型,两种物理叙事:审视多模态世界建模中的错位
多模态世界模型存在内部与外部错位:语言预测常正确,视频却与物理不一致。
AppliedScientist:通过迭代式AI评审实现论文自动修订
AI科学家与评审闭环迭代修订论文,评审引导修订优于固定提示自改,能解决实验问题但难改创新性缺陷。