预算优先资费推荐(BFTR):一种无过度收费的电信套餐推荐完整算法框架
提出BFTR框架,集成八种预算优先策略,实现零超收;递归混合策略最优,效用达0.946,执行时间小于10毫秒。
超越基于大语言模型的推理:用于智能体故障归因的轻量级图神经网络
提出轻量图网络AFANet,建模轨迹语义与智能体关系,以近零推理成本超越LLM基线,证明故障归因无需重型推理。
从存储到取用:通过显式提示与隐式推理实现大语言模型参数知识的可验证激活
提出VAKE两阶段强化学习框架,通过显式提示激活参数知识并迁移至隐式推理,优于基线,证实激活而非复制。
学习该在何处失败:面向对抗性数据策展的失败模式上下文老虎机
提出失败感知对抗检索框架,将数据策展建模为失败模式上下文老虎机,自适应选样,显著提升SNLI、ANLI等NLU基准准确率。
共享语法中的共享回路:跨语言追踪主谓一致
多语言大模型跨语言共享主谓一致回路,有屈折变化的语言间共享更强,英语在需要显性一致时更相似。
TranslatePsy-AfriSLM:面向低资源机器翻译的高质量数据扩展
为19种撒哈拉以南非洲语言构建开源翻译资源,过滤96%训练数据不降质,0.8B小模型超越27B/122B大系统。
Compress and Forget: bitsandbytes Quantization Amplifies Proactive Interference in LLMs
MemFuse:碎片化观察下的多源记忆融合
提出MemFuseBench基准与MemFuse系统,融合多源碎片化观察并保留来源可溯,实验显示综合性能最优。
Aslema在NADI 2026:少样本增强的口语理解
系统用少样本合成数据增强口语理解,微调优于零样本,意图准确率高,槽填充排名第一。
X2Streaming-TTS:具有语音状态继承的流式文本因果词元级语音合成
X2流式TTS实现严格因果词元级合成,用因果承诺与语音状态继承保证连续,低延迟且质量接近离线。
可读、忠实、被使用:语言模型中人口统计身份的三种可分离属性
人口身份可读、忠实、使用三者可分离;注意力头最忠实,因果使用不随忠实,探测改善但群体排序恢复少。
梯度幻象:大语言模型分割学习中可训练但标签不可辨识的梯度
梯度幻象破坏梯度与标签目标的一致性,令攻击者无法从梯度反推标签,同时保持训练效用。
基于执行过程的评估揭示语言模型在环境科学计算中的隐藏缺陷
执行基准揭示:选择题虚高≥12%;失败多因未持续应用已知公式;前沿模型在特殊条件下仍弱,需专家监督。
LLM自一致性中错误共识的分解:GPT-4.1案例研究
多数投票在难题上或适得其反;GPT-4.1上偏好渠道解释多数共识,但开放域存在不可解释残差,高共识非认证。
有序数据域上规范寄存器自动机的学习
提出有序数据域上确定性寄存器自动机统一主动学习框架,多项式时间可学习,整数域最小化可判定,改进复杂度
SMTrap:基于SMT冲突引导的针对大型推理模型的低成本拒绝服务攻击
提出SMTrap,利用SMT冲突计数引导生成推理密集型查询,无需模型反馈或GPU,实现高效DoS攻击。
识别隐含前提以实现论证图的逻辑重构
提出神经符号管道,用大语言模型生成隐含前提并转为逻辑公式,与显式前提/主张共同判定蕴含、矛盾或中立关系,在Microtext语料库上评估。
基于分层分析理解多语言医学语音识别适配
医学微调提升多语言医疗ASR,最佳模型因设置而异;英语微调主导编码器变化,多语言延续保留适配空间。
大型语言模型会幻觉出电子蜃景吗?
AI幻觉不仅是缺陷,更关乎机器意识:创造性与幻觉同源,情感自述亦是幻觉,真意识或不可知。
德语文本自然语言生成中的体验质量评估
提出德语NLG体验质量数据集TextQ-German,混合预测模型优于纯Transformer,验证泛化,提供公开资源。
MedUAG:面向医学多模态模型的统一理解与生成
构建最大医学统一理解与生成数据集(600万实例、14模态)与基准,训练MedUAG,多项任务表现优异。
现实场景中的测试时扩展:为何瓶颈在于利用而非探索
测试时扩展在开放任务中探索有效但利用失效,奖励模型相关性低,选优近随机,仅融合略有效,瓶颈在选择而非候选池。
结构、关联与决策价值:基于表示的难度估计用于非洲语言NLI自适应推理
研究发现表示统计量在非洲语言NLI中无法有效估计难度其显著性与决策目标关联不稳定不适合作自适应推理依据
机构报纸流水线:从历史报纸中提取数十亿高质量令牌
与波士顿公共图书馆共建流水线,从147万份历史报纸扫描中提取163亿高质量令牌并开放数据集。
为验证者分级:大语言模型推理的验证自主等级(L0-L5)
提出验证自主等级(VAL) L0-L5分类,核心发现完整性盲区:验证器只能确认候选正确,无法证明无遗漏。
DeepWeaver:弥合开放域问答中的证据合成鸿沟
提出深度编织框架,用思想块链整合证据,弥合开放问答检索与生成的证据合成鸿沟,提升充分性与引用质量。
机构藏书—富文本:一个可定制的多语言开源流水线,用于大规模OCR文本的去噪、去重与标注
发布哈佛图书馆98万册藏书的富文本版本,含2.17亿token,通过标注保留元数据,支持按需定制,适用于约250种语言。
隐私与仇恨言论检测的权衡:检测仇恨言论,但不以牺牲隐私为代价
仇恨言论检测可能以编码作者身份为代价侵犯隐私,需权衡。基准测试显示平衡隐私与检测困难但可行。
拦截袋鼠:以构造词汇、主动探测及大型语言模型为信息源和假设提出者的实验性星际语言学
实验星际语言学用构造词汇与大模型,以多策略协议拦截袋鼠误译,无未检出错误,覆盖随提议者能力提升
Reddit语料库评论级主题漂移分析
提出嵌入动态主题建模法,分析127亿条Reddit评论,政治社会话题漂移显著,音乐体育稳定。
SPADE:自适应合成可执行环境中的自我对弈
SPADE让单个语言模型用自博弈生成自适应可执行环境,并学习在其中行动,显著提升数学、科学、代码等多项基准表现。
MicroPython与CircuitPython:Python对物联网和机器人的悄然接管
本文分析两大Python嵌入式平台的发展,通过数据与基准测试发现,虽性能逊于C,但正成为原型设计与教育的主流语言。
基于函数+数据流构建实时数字孪生实例:用户评估及面向迭代管线的扩展
用户研究验证FDF建模环境易用可靠;提出层次化扩展H-FDF支持迭代模块化管线。
浅思深解:控制循环动力学以实现可靠的测试时深度
研究发现循环推理的动力学状态决定测试时增加迭代的效果,稳定算子不退化且可提升泛化,并给出深度安全条件与四条实用判据。
无金标准标签的AI生成数据去偏推断:通过多重不完美测量进行识别
提出DMM框架,利用多重不完美AI测量实现无金标准标签的有效推断,估计器一致且渐近正态。
选择、重组还是重新求解?单次测试时聚合的无候选对照
引入无候选对照,发现全错时候选条件化损害精度,多正确候选时提升;全错恢复解释被反转。
2026年儿童安全广告共享任务:面向儿童YouTube视频中的商业内容
识别儿童向YouTube视频的商业内容:广告类型、产品类别、法律风险三任务;45.5%未标付费推广。
真实世界人机交互中的多模态融洽度估计
真实场景人机交互中,零样本大模型估计融洽度有效,融合文本音频视觉特征最佳,需考虑情境变化。
是什么让软件问题解决任务对智能体变得困难?
提出框架并经大规模实证:任务难度可由静态特征高精度预测,关键为补丁碎片化与仓库规模,支持事前难度评估。
更多上下文,相同预算:超越Top-K检索的双界关系召回
相同预算下,双界关系召回比平面最高排名检索的完整证据恢复率提升23.8个百分点。
利用交互分解输出,提出IPS指标,发现监督微调、更大模型等四因素通过降低低阶交互敏感性来减小提示敏感性。
利用交互分解输出,提出IPS指标,发现监督微调、更大模型等四因素通过降低低阶交互敏感性来减小提示敏感性。
希腊法规检索基准:GreekBarRetrieval
发布希腊律师考试法规检索基准,含283题与6308条法条。实验表明LLM查询改写显著提升BM25和密集检索性能,十轮循环改写获最佳效果。
MLREF:通过大语言模型实现强化学习奖励设计的高效模块复用
提出MLREF框架,以模块池复用奖励组件,结合反思、混合信用分配与回滚合并,提升奖励优化稳定性,实验超越基线。
rEDMRec:将大语言模型推理蒸馏为可编辑经验记忆用于推荐
蒸馏大语言模型推理为可编辑经验记忆,轻量模型只检索记忆排序,多个数据集上优于基线。
MMD-Flagger:利用最大均值差异检测幻觉
提出MMD-Flagger检测幻觉:利用最大均值差异监控不同解码温度下LLM输出稳定性,据轨迹形状识别,在MUCH基准验证。
面向单步逆合成的化学合理性感知大语言模型训练
提出Top-K提示训练,用4560万反应训练化学约束语言模型,获最优性能,且模型互补,支持集成逆合成。
Open-MOPD:多教师在线策略蒸馏中能力失衡的诊断与修复
多教师在线策略蒸馏存在能力失衡,标准法仅达35.6%潜力;新框架经预算均衡与奖励刷新,回收率升至83.4%
Corrections of Zipf's and Heaps' Laws Derived from Hapax Rate Models
超越教师似然:面向长上下文推理的组校准在策略蒸馏
提出组校准在策略蒸馏,用分组相对残差调和教师与验证器分歧,显著提升长上下文推理的模型性能。
当可读性与源文保留相悖:AI翻译中的可评估性缺口
译文可读性与源文保留相悖时,质量评价存在可评估性缺口;复杂文本展示源文未必使评价体现保留差异。