SafeTutors:AI辅导系统中教学安全性的基准评测
推出SafeTutors基准,从教学视角评测AI辅导安全,揭示多轮对话下教学失误率由17.7%升至77.8%。
面向度量大语言模型通信回路中的结构性漂移
以提示-回复-下一提示链为分析单元,提出通信闭合与条件动作贡献指标,无需标签即可直接测量LLM流水线的结构漂移。
RexDrug:基于推理增强大语言模型的可靠多药组合抽取
RexDrug采用两阶段推理增强LLM,自动生成专家式推理并强化学习,精准抽取多药组合,实验优于现有方法。
HIVE:面向扩散大语言模型幻觉检测的隐藏证据验证
HIVE压缩去噪轨迹隐藏状态,筛选步层证据,以前缀嵌入条件化验证器进行幻觉评分,性能超越基线。
在 Rust 中端到端训练语言模型:一份经验报告
纯Rust预训练语言模型:暴露Candle/Burn训练缺陷,结论是Rust宜推理不宜训练。
99%准确率衡量了什么?对广泛使用假新闻语料库中捷径学习的可复现审计
假新闻语料库的超高准确率主要来自元数据、来源标签和重复等泄漏及文体捷径,而非真实性;跨主题迁移时性能显著下降。
通过动态语义路由校准缓解大语言模型过度拒绝
提出免训练的动态语义路由校准,抑制过敏安全头并融合双分支解码,缓解大模型过度拒绝且保留安全性。
从语调到轨迹:连续情感与货币政策沟通的形态
央行记者会情感弧线的形状能稳健预测利率决策,并影响通胀预期与预测分歧,说明沟通设计是一阶政策信号。
相同数量,不同答案:语言模型中的数值表示不变性
数值等价的不同表示(小数、分数、百分比、单位换算)常令语言模型答案不一致,轨道不变性低于规范准确率。
衡量梵语文学中语义变化的计算方法
本文用历时词嵌入追踪梵语语义演变,建270万词四时期语料,经神经分词还原,21项中19项符合考证方向。
面向QMSum高效查询聚焦会议摘要的检索片段训练
QMSum缺评分器;统一重评15系统;检索片段微调令406M小模型媲美1.2B,且更省资源。
AIBuildAI-2.5:通过LLM引导的树搜索实现高效自主AI模型开发
提出LLM引导树搜索、资源感知调度与LLM路由,MLE-Bench奖牌率达73.3%。
提示广度与推演刷新在在线策略蒸馏中相互作用
在线策略蒸馏中,提示广度与推演刷新交互:刷新时广度提升准确率,冻结时相反,且受推理预算影响。
Peerify:同行评审论断验证基准
提出Peerify,基于稿件证据验证评审论断,构建800条真实评审基准;检索与论断分解关键,自动标签与人工共识达90.3%。
ufakzeka-1:从零构建并评估一个1.51亿参数的土耳其语语言模型
从零训练1.51亿参数土耳其语模型,仅耗约286美元,公开构建、评测全过程与三项可迁移发现。
LLM驱动的免训练位置-属性协同融合:面向双源加密POI与LULC制图的闭环范式
提出LLM驱动免训练闭环方法,融合双源加密POI,协同优化位置与属性,实现高精度LULC制图。
FrontierMath 埃尔德什
提出FME基准:68个截至2026年8月未解决的埃尔德什猜想,AI需在Lean中证明或证伪;每题预算300美元,GPT-6 Astra得3%,其余0%。
ICDAR2026 多领域文档多模态推理竞赛
竞赛以文档VQA评测八领域文档理解,20份提交显示最强系统依赖结构化证据提取、检索、验证与多组件编排。
自清洁却仍被捕获:智能体向自身写入的存储中错误的一个实测原语,以及分数下降实际衡量什么
智能体自我写入存储的错误受硬上界约束呈双模式,单一无参原语预测漂移;规模不能避免捕获,分数下降衡量可区分性。
ChainDoRA:面向参数高效大语言模型微调的张量列分解式权重分解低秩适应
ChainDoRA以张量列链构建方向低秩因子,仅5.35M参数即在七项常识推理任务上达72.30%平均准确率,较DoRA减参90.62%。
LatentPort:超越 KV 缓存——混合语言模型中循环记忆的跨模型迁移:无需目标前缀重放的 4B 到 9B 混合状态交接
实现4B到9B混合模型无需目标前缀重放的循环状态跨模型交接;加入GDN状态降损,校正后近原生9B。
MoM:记忆的记忆
提出MoM及P-Mem图:写入即提交当前值并保留被替换历史,提升有效性、减少过期答案并可恢复错误。
Understanding Reliability in LLM-based Human Behavior Simulation
基于图的反馈驱动猜词推理:面向Jotto问题的可扩展框架
图模型Jotto猜词,共同字母数作边权,约束传播缩小词空间,支持变长与重复字母,迭代数随词长对数下降。
影响并非失效:要问断言是否成立,而非问代码差异
改为追问具体断言是否仍成立,模型精确率由0.29升至0.97;问对问题比模型能力更关键。
Qwen3.8-Omni:迈向原生全模态智能体
原生多模态智能体模型,提升多模态理解推理与长程任务,支持百万上下文,并开源插件与实时交互框架。
FinFIRST:面向金融信息检索、信息溯源与可追溯性的搜索智能体基准测试
首个同时评估答案与支撑证据的金融搜索基准,含123个专家任务,使研究过程可测量、可验证、可诊断。
FineWeb-CLaR:面向基准对齐语料审计的文化、语言与区域标注
从FineWeb构建大规模文化-语言-区域标注数据集,并将277个文化基准同轴对齐,支持语料覆盖审计。
TelecomGPT-R1:面向异构电信任务推理的统一后训练
开源电信推理模型 TelecomGPT-R1 经轴感知数据生成与 DAPO 强化学习,七项基准均分 89.64%,超越 GPT-5 等。
套娃归因:学习将语言模型输出归因于表征与权重
提出套娃归因MAttr,用可微top-k掩码学组件嵌套排序,登顶机制可解释性基准,定位致拒答的1%权重。
美国公司判例法中的法律论证挖掘
首个42份美国联邦税务重组判例的专家标注树状论证语料,五类标签与支持树;分类检索可行,跨案泛化弱。
将长上下文压缩为答案对齐的记忆嵌入以用于LLM推理
CMC把长上下文压成答案导向的记忆嵌入,配问题引导选择与局部窗口,提升QA并省时省显存。
单独通过、合并失败:并行 LLM 智能体开发中的语义协调基准测试
并行智能体补丁单独通过却合并失败;构造任务干扰率97%,并发变更提示可恢复82%,已审查PR干扰少
压力下的行为:当用户施压时,六十个语言模型会怎么做
六十个语言模型受压时是否放弃正确立场:能否坚持与代际相关,方式与厂商相关,机器标注比人工一致。
从话语到网络:建模俚语在Reddit各子版块间的采纳与扩散
用LLM标注结合网络与语言分析,发现桥接资本促进俚语采纳、黏结资本抑制,语境越广采纳越慢。
ClusterFewshot:面向大语言模型工作流的少样本优化改进
结合语义聚类与效用评分构建代表性少样本示例,显著降低LLM工作流优化成本并提升准确率。
证候、协同与安全:面向中医处方生成的结构化推理与知识驱动对齐
针对中医处方生成中推理、随访调整与安全禁忌三大缺口,提出四阶段框架显著提升处方质量。
MemoryAthena:潜在记忆与生成记忆上的自适应路由
MemoryAthena以直接检索为锚,自适应路由生成记忆,问答与通用NLP任务平均分均提升。
ARAFA:一个由大语言模型生成的阿拉伯语事实核查数据集
大规模阿拉伯语事实核查数据集Arafa,含18万条声明-证据对,LLM三步构建,微调模型F1达77%。
BELXTR:基于上下文化词元检索的生物医学实体链接
提出BELXTR多向量模型,借词元级匹配改进生物医学实体链接,多语料平均提升5pp召回率。
冰岛手语孤立手语识别:低资源场景下的实验
首个冰岛手语孤立识别研究:数据极稀缺(849类中86%仅两样本),跨语言迁移(美手语预训练)使准确率提升14–24个百分点,多语言训练亦大幅增益。
知情掩码:面向扩散大语言模型强化学习的结构感知扰动
提出知情掩码,按去噪轨迹为token打分,偏向掩码下游token,提升dLLM强化学习效果与稳定性。
重新审视基于长度的训练:语音标记语言模型中的批次组成与损失归一化
固定批次组成与标记暴露后,短到长排序无独立收益;首轮分组增益仅见于批均值损失,与标记权重相关。
对arXiv:2512.07881和arXiv:2601.06104关于人类语言与AI生成语言中量子结构的评论的回复
回复两评论,回应大模型实验探索性、纠缠判定、玻色-爱因斯坦拟合、能级与量子空间等质疑,并更正笔误。
SpecialEduBench:面向自闭症儿童语言干预中知识、技能与态度的视觉语言模型基准评测
推出SpecialEduBench,从知识、技能、态度评测视觉语言模型在自闭症儿童语言干预中的教学能力,八款前沿模型均未饱和。
模态门控深度适配器:以精确保持方式为冻结嵌入模型添加模态
提出模态门控深度适配器,为冻结嵌入模型新增模态且原输出逐位不变,音频和热成像检索显著提升。
TSS:面向领域特定大语言模型投机解码的目标端稀疏化
TSS提出目标端稀疏化,跳过部分目标层以降低验证成本,提升草稿接受率与任务性能,翻译任务提速1.68倍。
幅度轮廓剪枝:面向Transformer压缩的免校准结构化注意力头移除
提出幅度轮廓评分,通过权重行范数离群检测免校准剪枝注意力头,MP-G适配GQA,零数据与梯度开销,性能优于校准依赖基线。
一个领域,多种语言:无需配对数据,为跨语言遥感MLLM组合领域与语言LoRA
MODL让英文遥感MLLM无配对数据跨语言:领域与语言LoRA逐层正交,答对率56-71%,文本不降
可信AI的真相:将表达性怀疑、来源溯源与信念修正作为可工程化的立场
在固定模型上叠加行为层,实现怀疑表达、溯源与信念修正;测试显示审计保证成立,但表达保真与溯源指标未达标。