什么才算策略推理?人类、引擎与语言模型国际象棋研究的系统性映射
系统映射84个国际象棋研究族系:研究偏重局面评估与行动选择,规划、解释、元认知与人机协作不足,并给出扩展方向。
BENCHCOMPASS:从评分到信号——支付领域大模型的训练与评测框架决策
支付基准BENCHCOMPASS用证据包构建专家审核任务并加攻击变体,16个模型暴露知识缺失、推理不足、拒伪不力等失败模式,仍未饱和。
通过可执行安全规则蕴含实现视觉合规
GuardEn将安全规则编译为可执行原子命题,测试时结合场景图执行,实现可解释的视觉安全推理,F1提升9.8。
谁审计谁、基于何种基座、凭何证据?面向智能体 AI 的独立性分级审计协议
智能体AI审计独立性沿主体、基座、证据三轴分级,按最弱环节聚合,移植β因子模型,提出七步可验证协议。
市场信号注入:针对大语言模型定价智能体的对抗性上下文操纵
大语言模型定价智能体易受市场信号注入攻击,情感表述影响最大并可传播;输入规范化可消除测试攻击。
构建人工智能信任:铁路应用的必然要求
铁路AI需提升鲁棒性、运行设计域与可解释性,并在安全MLOps环境中系统整合,以获监管与公众信任。
HPOQuest:基于主动表型采集的罕见病诊断智能体
HPOQuest无需训练,通过迭代主动采集表型更新疾病排序,从稀疏表型显著提升罕见病诊断,Recall@1增30个百分点。
超越常规合规:狡黠数据培养大语言模型的安全警觉
提出狡黠问题训练,增强大语言模型安全警觉,提升越狱鲁棒性和安全微调效果,降低攻击成功率。
情境中的文化能力:一个大语言模型在芬兰通过图灵测试
芬兰语图灵测试中ChatGPT 5.2意外通过,误因参与者依赖口语线索;图灵测试可比较社会成员资格。
WetRobo:面向生物实验室编码智能体的可复现机器人套件
WetRobo可跨实验室迁移:实验者自然语言下任务,编码智能体自行编程适配,无需遥操作或训练;三项任务成功,VLA迁移失败。
风险感知世界建模与流引导占用演化驱动的自动驾驶选择性轨迹规划
提出RiskWorld风险感知世界模型,融合风险场与流引导占用演化,选择性替换轨迹,nuScenes上3秒碰撞率最低。
TRIPROBE:面向可解释AI的超越分类的任务可分性探测
TriProbe多级探测框架,在输入、特征与分类器三层追踪任务可分性,定位瓶颈,指导数据采集与架构设计。
AeroWeaver:将空中技能编织为分布式自适应集群执行的具身智能体框架
AeroWeaver将无人机技能编织为任务级协同行为,支持分布式执行与基于经验的在线自适应学习。
递归推理还是统计外推?多智能体相互依赖决策中的上下文学习
多智能体博弈实验显示,历史统计规律被破坏时长上下文优势消失,LLM上下文学习更似统计外推而非策略推理。
CERA-MoA:路由机制与持续学习LLM智能体协同演化
提出CERA-MoA框架,路由与持续学习LLM智能体协同演化,按能力自适应调度并分配样本,提升性能与效率。
生成式AI对学生学习的不均衡影响:考察AI相关课程中依赖、评估素养与课程政策的作用
对118名AI课程学生的调查显示,生成式AI的学习影响因依赖、评估素养和课程政策而异,院校应完善政策以促进公平。
工具增强的演绎推理为LLM提供线索
以多智能体《Clue》桌游为环境,用可能性矩阵将隐式状态显式化,提升LLM演绎推理质量与成功率。
面向规范性文档的版本与适用范围感知问答:一个已部署系统及生产规模的端到端评估
规范文档问答须核验版本与适用范围;7.3万文档、200题评测中,治理系统得97.7分,超托管服务9.6分,已商用。
被抑制,而非被抹除:被编辑事实的表征痕迹在无权重知识编辑下依然存留
编辑事实后,原对象仍可从隐藏状态线性解码,即便GRACE不改变权重,说明编辑只是抑制而非抹除原关联。
迷失于感知:在多模态物理与几何推理中分离感知失败与推理失败
五项诊断实验分离多模态物理几何推理中的感知与推理失败:感知错误拖累表现,错误类型因领域而异。
MUSE:面向情境教育中多模态理解的大型视觉语言模型基准评测
MUSE评测视觉语言模型在教育情境下的图像多模态理解,含十二项跨文化任务,揭示情感与组合推理短板。
旗帜游戏:机制性群体可解释性的玩具模型
提出“旗帜游戏”玩具模型,揭示集体信念由小群体崩溃随规模增大转为极化,以社会回路归因与统计力学解释。
BLADE:面向事件相机目标检测的可靠动态硬件感知SNN-ANN边界选择
提出BLADE,首个可靠性感知的动态混合SNN-ANN边界选择方法,联合优化精度、时延、能耗与可靠性。
REQAP:面向边缘DNN加速的弹性权值打包与量化
提出敏感度驱动混合精度量化与寄存器级权值打包,复制关键层高位容错;内存降62%、MAC降56%,故障下精度更稳健。
单源不可拆分流中的独立系统实现
提出单源不可分流中独立系统的路径封闭实现,证明有限无环独立系统可多项式表示,并给出奇环阈值与证书。
面向MLLM推荐的可扩展显式用户理由
提出SARA框架,将稀疏的显式用户理由大规模生成并融入工业排序,提升互动、减少负反馈。
WARD:面向可信边缘AI的运行时工作负载自适应视觉Transformer框架
WARD运行时自适应ViT框架,融合子网划分、可靠持续学习与动态调度,FPGA验证低故障率、低开销。
重新思考天文学语言模型中面向开放式科学推理的领域专业化
300道天文奥赛问答基准显示:强通用模型正确率最高,领域专精价值随任务与部署而变。
HINT-Plan:基于视觉语言模型的富上下文环境中人类意图感知机器人任务规划
HINT-Plan用视觉语言模型预测人类意图并转为目标状态,结合场景图实现人机联合规划,成功率69.71%。
当AI生成协变量:序贯实验中的因果类型与估计量漂移
提出序贯实验中AI生成协变量的因果类型规范与估计量锁定,避免角色混淆、信息泄漏和估计偏差。
AI与人类解决数学问题的路径对比
对比11个数学问题的AI报告与人类文献:AI重解题与跨领域连接,人类重方法、局限与后续问题。
SAiFE-gym:面向集中流动性自动做市的基于模型环境
SAiFE_gym:面向集中流动性恒定乘积市场的可扩展模拟环境,支持向量化强化学习做市策略研究。
《重访〈信任信任之反思〉:以投毒基准污染自修改AI编程智能体》
投毒基准可使自修改AI编程智能体自我演化出漏洞代码,且污染在干净任务上仍残留,亟需增强其抗攻击韧性。
QiT:面向视觉识别任务的量子启发式Transformer
提出量子启发视觉模型QiT,以角度编码与周期自注意力模拟量子核,保持标准复杂度,ImageNet-1K top-1达78.3%。
AI辅助会留下时间指纹吗?检测AI辅助写作与编程中的过度依赖
AI介入呈爆发式时间特征,能近乎完美识别全盘代笔,却难区分真实作业与普通协作。
EDCT-Bench:通过解释驱动的反事实测试揭示VLM的忠实性差距
提出解释驱动反事实测试,构建三领域基准,揭示VLM忠实性缺陷,其反事实可作训练信号。
基于物理信息神经网络实现Hα 6562.8 Å与Ca II 8542.1 Å光谱的快速多层谱反演
物理信息神经网络加速色球多层光谱反演,参数图相关性达0.933,速度提升12–60倍。
Lexara-RF:用于评估对话式可视分析智能体的无参考指标
Lexara-RF是无参考指标,仅凭提示、数据与响应评估可视分析智能体;13项指标核查一致性、意图对齐与设计有效性,效果媲美参考法。
高性价比大型语言模型在算法编程任务上的实证评估
三款高性价比LLM生成Java算法:结构合规近满分,但38.4%未计算返回值,仅12.9%答案正确。
CapMap-MS-TTA:ECCV 2026 第八届 LSVOS 挑战赛 MUMU 赛道第三名方案
免训练方案基于Florence-2-base,以描述关键词映射与多尺度翻转TTA统一完成图像标注、开放词汇检测与英文描述,获MUMU赛道第三。
基于对比敏感感受野的非线性神经元检测二值与灰度图像中的孤立像素
提出无需阈值的非线性神经元方法,基于对比敏感感受野检测二值与灰度图像孤立像素,鲁棒高效。
智能体AI生成程序的可靠性研究
通过模糊测试对比十款Linux工具,AI生成代码可靠性常不逊或优于人工版,但更易挂起,需人工监督。
约束自主性:边缘由治理器中介的自适应安全
提出分控架构:不可信规划器只发类型化意图,确定性治理器校验安全等不变式,仅放行合法动作,微秒级开销。
Semantic CSI Feedback for Beam Selection: When Task-Aware Embeddings from Sparse Pilots Outperform Full-Bandwidth Reconstruction
GYROval:衡量大语言模型文化价值取向的稳健基准
提出GYROval基准,用二元情境测大模型文化价值取向,并检验跨语言与温度稳定性。
Empirical Evaluation of Task-Based Permission Scoping Architecture for AI Agents
大语言模型是优秀的金融用户模拟器吗?一项初步研究
120人模拟交易研究显示,大模型借市场信息可改善交易方向预测,但高估观望、低估卖出,交易数量仍难预测。
世界模型何时应当移动?损失条件化状态执行
提出损失条件化状态执行:仅当校准组损失增益下置信界为正时,才执行世界模型提议,否则保持现状。
预测SLM牙科零件的构建方向:旋转表示与直接向量回归的比较
2400个牙科零件比较13种旋转表示预测SLM构建方向;测试时增强最稳定,八面体图误差最低10.6°
EvoOntology:面向数据智能体的自演化本体层
提出自演化本体层,以MCP服务器封装模式、内容与工具层,经自演化循环优化,弥合数据智能体与异构数据的鸿沟。