人工智能在微生物致癌研究文献的证据提取与批判性评估中可与领域专家匹敌
大模型在微生物致癌文献证据提取与评估上媲美专家,但方法学评估与矛盾识别仍有短板。
用于智能体强化学习的轨迹相对事后蒸馏
提出轨迹相对事后蒸馏框架,以回合对齐评分重分配密集监督,超越GRPO,成功率由56.4%提升至75.2%
GeoBenchLLM:地理相关任务的大语言模型综合评估基准
提出综合地理基准,用十二个数据集评估大模型时空理解,发现推理能力与模型规模影响显著。
ResidencyRL:模拟临床环境中的强化学习
基于模拟临床环境的强化学习训练AI,诊断准确率提升7%,漏诊红旗征降31%,专家偏好率87.6%。
利用LLM代理与知识图谱的协同作用进行城市社会经济预测
提出LLM代理与知识图谱协同框架,通过元路径推理和跨任务知识共享,提升城市社会经济预测精度。
PsychoAgent:一种面向LLM智能体的冲突感知记忆的情感敏感认知架构
该架构分离事实与情感记忆,由冲突感知控制器整合,在冲突场景中检索关键记忆优于基线,支持情感敏感检索。
SkillProx:基于近端文本梯度下降的智能体技能自我进化
近端梯度正反向框架,结合闭环诊断进化与效用感知近端细化,智能体技能准确率平均提升3.0%
AfriNLLB:面向非洲语言的高效翻译模型
非洲轻量翻译模型,覆盖15个语言对,通过剪枝量化压缩NLLB-200,性能相当且速度更快,并公开数据。
长推理链如何影响大语言模型对答案事实性的判断
研究发现推理链的流畅性与事实性显著影响LLM评判,弱评判易被误导,强评判也难辨真伪。
跨资源谱系的依存句法分析:评估高资源与低资源语言上的架构
低资源下LSTM优于Transformer;数据增加后Transformer反超,交叉点常见于低资源树库规模;形态复杂度亦有影响。
自学习诊断代理的推理与双记忆联合优化
SEA代理联合优化推理与双记忆,将经验转化为可复用知识,诊断准确率达92.46%,持续学习能力显著提升。
协同增效:量化AI辅助招聘的收益
AI面试助选候选人通过终面率提高17.5-20个百分点,尤益于初级者;75%未完成面试,但流失本身反映求职动机。
基于意图感知改进带引用的长文问答
提出基于标签的意图感知方法提升长文问答生成与引用质量显著改善大模型和小模型表现及报告可读性
Skill-RAG:基于隐藏状态探测与技能路由的失败状态感知检索增强
提出Skill-RAG,探针检测失败状态,路由器诊断错位并选重写/分解/聚焦/退出,显著提升复杂问答准确率。
思维速记:基于熵引导的超令牌压缩大语言模型推理
熵引导超令牌压缩推理轨迹,平均缩短8.1%,13/15基准精度等效;超令牌对应回溯、验证等可解释推理模式。
决策前摒弃刻板印象:评估内在偏见缓解对LLM下游公平性的影响
提出公平感知概念遗忘(FACU),缓解LLM内在性别偏见,可提升下游公平性,且不显著损害性能。
Kimi K2.5:视觉智能体智能
Kimi K2.5开源多模态智能体,图文联合优化,Agent Swarm降延迟4.5倍,多域SOTA
重新思考并形式化跨语言中的“状态”:一种统一的计算学习理论解释
状态被重新定义为跨语言的系统性形态句法机制,形式化为集合函数,用学习算法预测语法配置。
VISHC在PsyDefDetect:基于上下文感知合成增强缓解心理防御分类数据稀缺
提出上下文感知合成增强与混合模型,显著缓解心理防御分类数据稀缺并建立强基线。
LiveMem:在长期运行的LLM推理中保持记忆状态连续性
提出LiveMem,通过固定容量记忆状态维持长期LLM推理的历史连续性,即使证据移出当前上下文也能正确回答。
每瓦智能:衡量本地AI的智能效率
本地模型可答88.7%查询,能效五年提升5.3倍,覆盖率达71.3%,且本地加速器能效优于云端1.4倍。
SignVerse-2M:55+手语的二百万片段姿态原生宇宙
含55+手语、约200万片段姿态原生数据集SignVerse-2M,DWPose统一处理,支持开放世界识别与生成。
MetaSICL:通过元语音上下文学习,将听觉大语言模型推广至服务不足的说话者和语言
提出MetaSICL后训练法,仅用高资源语音数据增强听觉LLM的上下文适应能力,无需目标域数据,即可提升低资源任务性能。
反事实模拟训练提升思维链忠实度
提出反事实模拟训练(CST),通过奖励能预测反事实输入的思维链来提升其忠实度,显著改善监控准确率与可模拟性,优于提示基线且效率更高。
HFS:面向高效视频理解的整体式查询感知帧选择
提出端到端任务自适应帧选择:SLM查询感知评分与连续集合级目标优化,配合师生互学习,超越现有方法。
从计划到行动:智能体在多大程度上遵循计划?
分析21,120条轨迹:无计划时依赖内化,差计划比无计划更糟;提醒可提升遵循度。应训练模型遵循计划而非记忆。
Multi-Legal-Bench:跨司法辖区、语言和法律传统的大语言模型法律推理评估
首个跨司法辖区法律基准,覆盖6国1.65亿判决,发现少样本增益不均,跨语言迁移不循语言邻近性。
低精度Softmax Transformer与(摘要式)思维链的表达能力
分析标准Softmax Transformer,以对数规模模拟图灵机,摘要式思维链更高效,实证支持。
Fortran通用转译器:概念验证
提出FGPT转译器,将Fortran转为GPU/可微/NumPy/JAX代码,语义不变,气候内核验证通过。
超越情感:传统NLP与基于LLM的多维分析在政治新闻评估中的比较
传统情感分析将70%政治新闻判为中性,掩盖深层话语;LLM多维分析能识别偏见、框架等,更契合社科研究。
仿真器锚定的大语言模型用于工业因果推理:面向污水处理决策支持的工具使用、结构化注入与跨厂可移植检索
比较三种接地法:实时仿真器99.5%、结构化注入79%、可移植检索75.8%;后者支持反事实、可跨厂迁移,通用任务达79%。
PoolBench:仅解码器大语言模型概念表示评估中的池化策略基准
构建PoolBench基准,评估19种池化策略,层级池化优于末token,强检测不保证强引导。
通用病理,条件后果:多跳溯源RAG的三重稳健性分析
GraphRAG过引用普遍,但影响随语料而变;单评判者LLM不可靠;三重稳健性分析是评估RAG架构的最低标准。
大型语言模型威胁双盲评审
大型语言模型仅凭标题与摘要即可识破论文作者,削弱双盲评审匿名性,需重新审视AI时代的评审公平。
RIG-RoPE:关系与实例门控的旋转位置编码及时长感知时间坐标
提出RIG-RoPE:仅同实例做空间旋转,时间按信息时长插值,无新增参数。
电路锚定的安全进化
受发育约束启发,提出电路锚定进化:锚定<2%安全回路,余部自由演化,极小能力代价保安全,优于奖励约束。
SemiAdapt-Instruct:通过潜在领域专用适配器实现可扩展的指令微调
提出SemiAdapt-Instruct模块化框架,以潜在领域适配器并行训练和免参数路由扩展模型,新增领域仅需单适配器更新,优于全量微调。
大语言模型中思维链推理的平均场动力学
将大语言模型推理视为线索图上的引导发现,用平均场近似导出常微分方程,实验统计规律可被拟合。
脚手架介导的后训练:模型参数与程序性脚手架图的协同演化
脚手架介导后训练参数与脚手架图协同演化自动技能提升通过率8.1%蒸馏后无脚手架仍27.7%优于SFT
跨架构语言模型中的转向迁移:一项系统性实证研究
首次系统评估跨模型转向迁移,发现≥1.7B参数时概念方向可跨模型控制行为,小模型失效。
约束优先推理:无需训练地利用答案空间约束的数学解题协议
提出约束优先推理(CFR),两阶段提示先提取约束再求解,无需训练,提升数学解题性能。
使用Whisper的波斯语语音情感识别中ASR适配与表示降维研究
波斯语情感识别中,Whisper编码器特征经PCA降维有效提升性能并降低开销,ASR微调收益有限。
英语源多语言RAG中隐私风险何在:跨五种查询语言的分阶段审计
英语源RAG中,仅输出过滤时英语泄露最高;加输入审核后阿语和斯瓦希里语仍残留,附加原文可堵住15/17。
大语言模型中的条件性认知偏差:有偏用户轮次如何调节上下文推理
提出三条件框架评估多轮交互偏见,8个模型中6个偏差增强,并识别两种竞争机制。
DREAM:基于事件感知记忆图的LLM动态角色扮演
DREAM用事件记忆图构建动态双粒度角色画像,提出TCM基准,在多个测试中达最优,增强角色一致性与可解释性。
ConWriter:转换约束下的有状态长篇故事生成与轻量级神经符号一致性控制
ConWriter是无需训练的框架,通过场景级增量生成、符号状态推理和风险信号,维持长故事一致性,避免错误累积。
CNM-BERT:基于表意文字描述序列的汉字即插即用结构嵌入
CNM注入汉字IDS树结构至BERT,不改主干,OOV准确率+9.8,F1+7.7,多项任务提升。
LLM翻译中的数值本地化分析
分析五款可本地运行的LLM对时间、数字、日期的本地化能力,发现将本地化原则嵌入提示词显著提升准确率。
立场:是时候针对自洽性优化大语言模型了
提出以自洽性为框架理解大模型失败:根源于单输出评估假设,多种技术属一致性优化特例,优化可提升能力。
大语言模型中类人回指消解
探究五个大语言模型对回指消解多个因素的反应,发现其与人类认知存在选择性对齐,对语义干扰不敏感。