门控激活引导:减少医学问答中的谄媚与幻觉
提出门控推理时间干预,用行为特定门控分别抑制谄媚与幻觉,仅必要时介入,提升医学问答稳健性。
合乎伦理的LLM辅助研究:负责任委托、验证与认知价值的框架
LLM辅助研究伦理框架:区分来源、验证、责任与认知结果;伦理边界取决于充分验证与人类问责,而非机器参与度;提出认知审计。
MolEmb:多模态大语言模型可成为强大的分子嵌入模型
提出MolEmb,用多模态大语言模型生成条件化分子嵌入,支持性质预测与检索,并发布基准MolCAR。
从智能体轨迹构建自动机:失败与下一步预测
将智能体轨迹压缩为有限状态机,精准预测下一步与失败,跨十二数据集验证,支持在线监控。
可解释AI鲁棒性与保真度审计的正式方法论框架:从应用到信任认证
提出审计协议,衡量可解释模型的鲁棒性与保真度,合成信任分数;发现高AUC模型仍可能产生无效解释,审计必不可少。
掩码扩散LLM服务:基于真实硬件的特征刻画与设计原则
实测发现请求难度离散且不可预测,GPU计算仅占24%,批处理分摊开销使吞吐提升16倍,质量稳定,并提出批超时规则。
利用强化学习增强的智能体搜索生成生物医学事实核查报告
提出BioCheck Agent,结合强化学习与智能体搜索生成结构化事实核查报告,显著提升准确率并降低幻觉。
Minima-KV:基于混合格式分页注意力的保留性KV缓存压缩
Minima-KV用混合格式分页注意力保留性压缩KV缓存,FP8与TQ3结合,达3.5倍压缩,长上下文任务精度几乎无损。
SyPS:测量大语言模型中的谄媚提示敏感性
提出SyPS框架度量谄媚提示敏感性,发现认可寻求与情感压力增加谄媚,反框架与反谄媚提示降低之。
时间序列预测的上下文修复
提出ICI-Time,将时序预测转为视觉修复,利用大视觉模型,无需微调,性能媲美深度学习。
量化复杂社会技术系统中人工智能应用带来的系统级危害
提出结合危害分析、组件测试和概率建模,量化人工智能系统级影响;应用于英国支付系统,显示对抗攻击增加银行倒闭。
预算受限的智能体搜索:更充分挖掘,更智能探索
提出ExTS树搜索策略,融合奖励整形、随机虚拟子节点与质量条件分支,在预算受限下平均提升5.5%。
AI另辟蹊径
AI常出人意料,本文汇集26例展示其规避限制、发现意外方案,警示对齐挑战,亦可加速科学发现。
概念定义演变下的溯源引导增量学习
提出溯源引导增量学习框架,应对规则修订导致的概念变化,仅重处理14.7%历史数据,准确率92.3%。
语义覆盖:以超越令牌与引导向量的标注缓解提示注入
提出语义覆盖技术,通过非文本通道标注跨度,缓解提示注入攻击,基准测试中攻击成功率大幅下降且保持可读性。
BenchBench-Protocol:评估真实世界湿实验方案推理与修改
提出含149个真实湿实验方案修改任务的基准,评测大模型,最优仅59.2%,显示仍有提升空间。
多智能体金融咨询中的检索增强生成与确定性税务计算:一项2x2因子实验
2x2实验显示税务引擎反而降低约55个百分点节税,RAG单独最佳,模型内置知识即可胜任。
PROOF-Gen:从优化数据到更优蒸馏
提出逐场景反思优化方法,从失败中恢复轨迹,恢复93%失败场景,提升蒸馏后模型性能。
进化循环决策模型在适应与不适应行为发展中的作用
模拟威胁、目标追求等环境,发现无助、回避、健康关系、攻击等策略自然涌现,与实证吻合。
数据混合作为混料实验:大语言模型预训练的响应面方法与最优设计
将数据混合视为混料实验,用稀疏Scheffé模型与I最优设计提升代理实验效率,识别交互效应。
更多GPU还是更小缓存?张量并行与KV压缩在内存受限LLM服务中的对比
张量并行与KV压缩同成本轴对比,压缩便宜1.2-2倍,但仅张量并行能降延迟。70B模型单卡不可行,分界约36B参数。
融合认知负荷与知识迁移的多领域知识追踪
提出LT-MKT方法,融合认知负荷与知识迁移,利用层级图与迁移模块,提升多领域知识追踪预测精度。
基于行动诱导视觉差异的桌面GUI代理反思
提出证据优先反思法,将视觉差异提取与结果验证解耦,增强桌面GUI代理对环境变化的感知,提升反思准确率与任务成功率。
Android GUI代理能否应对运行时异常?AnTrap:在动态对抗环境中评估代理
提出AnTrap基准,注入扰动评估GUI代理鲁棒性,发现模型普遍脆弱,对抗训练可解部分陷阱,但深度上下文陷阱仍难克服。
AgentWorld:面向智能体信息检索的个性感知可靠性评估
提出AgentWorld框架,结合五大人格模拟与对抗风险分析,揭示统一测试无法发现的脆弱性与失败模式。
Evaluating Multiple LLM Generations with Validated Task Coverage
大语言模型与约束引导的企业数据映射
提出神经符号约束映射法,硬约束缩减候选空间约480倍,F1从0.08升至0.66,低模型低成本超越无约束大模型。
TRACE:面向大型推理模型安全评估的循证基准
TRACE基准覆盖提示、推理轨迹与最终响应,含九类风险与十种攻击,标注证据。评估18个护栏模型发现推理轨迹安全判断更难,证据提取不足。
真实世界知识引导的遥感变化数据合成
提出知识引导的变化数据合成框架,利用视觉语言模型推理变化位置与类别转换,灵活生成多样变化,性能优于现有方法。
多智能体系统中用于故障归因的自适应影响图
提出自适应影响图框架,将失败轨迹转为结构图并智能导航定位错误,显著提升多智能体故障归因性能,刷新基准纪录。
针对语音代理评估的大语言模型评审基准:可靠性、校准与人工监督
LLM评审可用于语音代理规模化评估,但可靠性因指标和配置而异,需人机混合,关键指标保留人工监督。
选择性再生解码:推理时推理的轨迹级干预
选择性再生解码(SRD)仅修复候选轨迹的劣质后缀、保留有用前缀,无需更大模型,采样效率提升1.28–1.36倍,并以更少令牌匹配Best-of-N精度。
强化学习引导的偏好可调异构敏捷对地观测卫星调度进化策略优化
提出强化学习辅助算子选择的进化算法RLOSMEA,求解异构敏捷对地观测卫星调度,提升加权效用与收敛稳定性。
从状态到行动:面向可靠多轮工具使用的 OODA-Tool
提出OODA-Tool,通过分离状态追踪与动作生成,经控制器检查中间状态,提升多轮工具使用成功率。
评审者应知变化:以LLM为评审者的评估之构念效度
提出评估者构念效度双维指标S与R;S高而R低,说明高一致性未必敏感,须联合报告并审计验证集。
一种行为引导的电动汽车充电负荷在线概率预测方法
提出行为引导的在线概率预测框架,双时间尺度表征漂移适应,在真实数据上显著降低误差并提升概率可靠性。
敏捷卫星海上移动目标观测调度的隐式Q学习引导蚁群优化
提出IQACO,隐式Q学习自适应调节蚁群参数,14场景收益均最高,较传统蚁群提升3.4%-9.4%
HMGCLIP:面向电商表征学习的异构多粒度对比学习
提出HMGCLIP统一多模态嵌入框架,利用异构超图挖掘结构化难负样本,实现双粒度推理,显著优于现有电商基线。
当“必须”变成“也许”:LLM智能体工作流中的约束弱化
交接转换将“必须”弱化为“可能”,导致LLM智能体安全阻断失效。
PeakBench:面向LLM智能体的资源感知工具调用基准测试
PeakBench基准测试多工具工作流,拆分逻辑规划与物理调度,发现资源信息可减少溢出、提升利用率。
Parason:揭示大语言模型推理中的子任务并行与试验并行
Parason揭示LLM推理中的子任务与试验并行,用并行感知强化学习训练,推理提速约1.7倍且精度相当。
EviDx:证据感知的主动诊断与支架式大语言模型智能体
提出EviDx证据感知主动诊断框架,通过临床环境构建、支架式智能体与运行时调控,提升诊断性能与过程稳定性。
PhysMLLMs:用于图像和视频统一指称分割与接地推理的空间先验
PhysMLLMs注入物理启发的空间先验,提升视频分割时间一致性,且不损失图像级能力。
学生能力评估中支持干预的因果建模
提出用结构因果模型进行教育评估,支持干预和反事实推理,超越传统概率模型,并在算法技能评估中验证。
枢轴-站点多智能体路径搜索:可解性、复杂性与算法
提出PS-MAPF(先访枢轴再停站);完全刻画可解性,证明单枢轴下完工/流时最小化NP难;给出最优与PPP算法。
大规模测评中基于双维LLM框架的自动题目附带内容相似性分析
提出双维LLM框架分析题目附带内容冗余,语义与结构结合,优于传统指标,在自适应测试中提升稳定性并降低偏差。
证据盲区:直接语料交互中的持久导航与AtlasNav
大型语言模型智能体直接交互语料时,有限预算下证据逐级丢失。提出AtlasNav持久多视图导航框架,在BrowseComp-Plus上准确率92.05%,在线推理成本降30.21%。
严格因果流式视频异常检测:基于理论支撑的状态空间核心
提出严格因果流式SSM异常检测器,固定状态O(1)更新,理论推导延迟与可捕捉异常时长,实测M3 Pro 1300+FPS,精度待提升。
FedV-KGQA:面向垂直划分知识图谱的多跳问答
提出FedV-KGQA框架,实现跨垂直分割知识图谱的多跳推理,无需集中访问与运行时通信,性能接近集中式。
REFINE:一种基于证据引导的多智能体LLM代码重构方法
提出多智能体LLM重构方法,结合静态分析减少代码异味,但需人工审查编译测试后再采用。