EnSiTa——面向领域特定机器翻译的三语多领域平行数据集与评测基准
发布英、僧伽罗、泰米尔三语七领域平行数据集,系统评测六向领域机器翻译。
PROOF:面向大语言模型对象级事实可靠性的画像式评测
PROOF基准用18,486道多选题画像化评测大模型事实覆盖,揭示领域差异、改写敏感与过度自信。
StepCOPS:面向语言模型策略选择的闭合检验下尾证书
StepCOPS用提议集提名候选下尾底线,经二项检验与Holm逐步法认证,选定策略覆盖率达96.4%,底线较基线高1.5分。
跨模型不动点普查在重复问题上能裁定什么、不能裁定什么
跨模型短窗不动点普查17个预训练模型:重复类别稳定且普遍,但无法完全仲裁重复源于数据还是网络。
小型MLA-SSM混合语言模型的探索性消融研究
MLA-SSM混合模型消融:移除SSM损失最大,移除MLA影响小;稠密FFN优于三元MoE,省显存。
ModularSQL:面向Text-to-SQL多重性盲区的运行时护栏
暴露Set-EX多重性盲区,提出Multiset-EX评测与轻量运行时防护ModularSQL。
TTLab在AlexandriaX-2026:用于阿拉伯语机器翻译错误片段检测与分类的微调表层标注器
将阿拉伯语MT错误片段检测建模为表层词级分类,结合焦点损失与方言阈值,MARBERTv2最优,排名第三。
办公规模验证搜索中的算子包、提议器强度与构造族平台期
验证搜索2³因子实验:算子组合缩小差距、排斥增多样性且无正向交互,前沿提议器更强,构造族提示致平台。
DP-IPI:面向临床文本中间接个人标识符的混合差分隐私文本改写机制
仅对含间接个人标识符的片段做差分隐私改写,降低临床文本重识别风险并保持连贯可用,优化隐私-效用权衡。
LLMersion:面向教育公平的低成本家庭语言学习本地优先AI智能体框架
提出本地优先开源AI智能体LLMersion:用小型模型与自有文档在家练四技能,低成本促教育公平。
加纳语言青少年健康传播中自动语音识别(ASR)的基准评测与领域自适应
加纳三语ASR基准评测与微调适配:Ewe词错误率由109.3%降至64.8%,瓶颈在域内数据。
自信却错误:面向低资源自动译后编辑的受限解码诊断法
提出免重训的推理期诊断法,通过编辑距离惩罚曲线区分低资源译后编辑的失败模式:二元坍缩与自信误校准。
随机语义证据图:面向智能体 AI 的不确定性传播与治理
提出随机语义证据图,量化不确定性来源、传播与输出可用性,辅助治理。
TTLab在StanceEval-2026:面向阿拉伯语立场检测的完形填空式提示方法(CLASP-Ar)
将阿拉伯语立场检测重构为完形填空式掩码语言建模,通过受约束标签词表预测,避免多任务学习复杂性。
JEV 与 LLM 作为评分标准裁判:更便宜、更快,且在同样地方出错
JEV比LLM评审便宜29–325倍、快30–220倍,准确率相近,但错误高度相关,级联增益甚微。
PPTBench:编码智能体能否通过结构化、可编辑的幻灯片重建视觉世界
PPTBench:以可编辑PPTX重建论文流程图,500任务;最佳仅67.80分,视觉语义还原仍难。
TimeBraid:统一时间序列与语言以实现理解与预测
提出TimeBraid统一模型,通过交错注意力对齐语言与时序基础模型,兼顾理解与预测,性能媲美更大通用模型。
基于滑动窗口方法的命名实体识别
提出免重训的滑动窗口推理流水线,将句子级NER模型扩展至文档级,避免边界碎片化,F1最高0.8902。
CORDIAL:从少量标签校准序数型LLM输出
将LLM输出视为真实标签的含噪读数,用五参数通道校正,仅需少量标签即可校准,多数设置下对数损失最低。
面向低资源语音识别的自适应Fisher白化交叉协方差
提出自适应Fisher白化交叉协方差,以任务感知子空间和自适应秩分配提升低资源语音识别参数效率。
VietPrism:一个具有多样方言与语码转换的大规模越南语语音及深度伪造语料库
大规模越南语语音与深伪语料库,涵盖方言和越英语码转换,含993.4小时真实及3.1K小时伪造语音,暴露检测模型脆弱性。
编码了却未解码:LLM句法三级差距的层局部化证据
提出行为、LM头、探针三级评估:探针可恢复性≥读出≥行为,差距源于主语控制,指令微调加剧。
MILO:基于块级低秩压缩的高效多样本上下文学习
提出MILO,按块级低秩压缩KV缓存,依信息熵动态分配秩,内存降50%、吞吐提升1.8倍,性能几乎无损。
文化差异保留:诊断大语言模型模拟调查人群中的扁平化与漫画化
提出文化差异保留指标CDP,基于一次性人工校准,识别跨国差异缩小(扁平化)或放大(漫画化),揭示传统保真度指标与CDP的系统性偏差。
基于上下文化词表示的多任务学习用于形态丰富语言的句法分析
面向形态丰富的乌尔都语句法分析,提出基于上下文化词表示的多任务学习,显著提升成分与依存句法分析性能。
你的Transformer能同时容纳两种思路:大语言模型中线性叠加的证据
LLM呈线性叠加:输入线性组合时输出叠加各下一词分布;此源于架构,可微调恢复,单次前向生成两段续写。
ChunkRank:面向LLM流水线的模型感知文本分块与弃权感知答案选择
ChunkRank开源库按模型分词器与上下文窗口分块选答,实验显示内容排序难胜首个非空答案,因阅读器弃权。
面向长文档问答的VLM流水线实证研究
长文档问答VLM流程实证:代理收益依模型规模,检索模态比检索器关键,图像检索省词元,多流程互补。
面向金融服务的领域自适应检索增强生成式自动合规问答
领域自适应检索将Recall@10提至0.774,但小模型生成的增益未证实有真实依据。
人工社会基准:合成研究的验证框架
提出人工社会基准,用11项测试检验合成人群效度:模型回答过于一致、压缩量表,单域可信难代表整体。
模型陈述的拒绝候选人的理由是否起作用?
模型拒绝候选人的理由有部分作用,但关键对比不显著,位置与无关句效应更强,仅界定效应。
衡量跨厂商与版本模型行为的低成本检测方法
提出低成本可复现模型行为检测,跨厂商版本运行,三种读数揭示行为差异与变迁。
面向第二语言发音分析的母语参照音素类几何
提出母语参照音素类几何,无需发音标注或配对录音,其投影距离与口语水平及发音质量负相关。
R-DEIM Net:一种用于复述检测的高效理据增强双专家交互模型
提出76M参数双专家模型R-DEIM Net,在Quora复述检测达90.07%准确率,并能生成可读理由。
双向评分:大语言模型能实现其无法可靠解析的MRS
MRS双向评测:大模型生成强,但解析远逊ACE;生成高分不等于理解形式语义。
评估结论的可复现性如何?对LLM推断提示结构的自审计
LLM评估排名常被高估;重复推断不稳定,仅最差模型可靠,最佳/中间排名不可靠,可复现不等于准确。
返回还是修订?学习何时修订有助于检索增强问答
提出可恢复性预测修订效果,训练策略决定返回或修订,提升检索增强问答,但不及在草稿与标准RAG答案间选择。
什么、何时与如何:音频描述作为受约束的全局优化
将音频描述形式化为受约束全局优化,联合决定内容、时机与表述;大模型提议并用整数规划调度,提升叙事与时间指标。
面向无监督野外语音挑战赛多语言语音表征的BiMamba2掩码离散单元预测
BiMamba2掩码离散单元预测多语言语音表征,在67语种无标注数据训练;说话人聚类ARI达0.735超越四基线,但LID与CER仍逊于有监督。
ARGUS:面向美国就业歧视投诉的角色感知事件知识图谱
ARGUS结合5W1H模式、法律领域模型与LLM,从投诉文本构建文档级事件知识图谱,提升诉求分类与法律问答,检索后证据组织效果最佳。
面向自动语音识别的词元级转写歧义容忍训练准则
提出词元级容错训练,将通配路径细化至词元并融合词级路径;多语言均优于CTC,WER降9.45%。
SemMSA:面向不完整数据的潜在语义辅助鲁棒多模态情感分析
提出SemMSA,用LLM构建情感语义,经跨模态语义精炼与谱对齐融合多模态,在不完整数据下达最优。
音频语言模型对听与读的区别性特征表征是否一致?
音频语言模型听读区别性特征表征多不一致;仅Qwen2.5-Omni浊音超随机基线,模型家族比规模更关键。
JevOut:自然语境即可颠覆决策模型
简短自然语境即可将决策模型的正确判断翻转为高置信度错误选择,翻转率达六至七成。
网络阴谋论的智能体检测
提出智能体框架,借助社交语境工具推断发言意图,在希伯来语推文上显著优于纯文本分类。
中文标题:查询同盟:学习检索动作
中文摘要:轨迹微调使小模型胜任检索问答的动作控制器,动作预测宏F1由0.17升至0.65,端到端精确匹配提升至0.79。
家庭不受保护区:算法治理与对话式AI中施害者话语的再生产
六款AI:四款拒答率<1%,亲密框架令漏答放大4–11倍,新会话96%以上复发,即“家庭不受保护区”。
Spooftral:Voxtral 音频-语言模型能否检测语音欺骗?
Voxtral检测语音欺骗,DoRA轻量适配提出Spooftral,ASVspoof5上EER 4.25%。
来自主动语音代理蜜罐的真实诈骗与骚扰电话对话语料库
主动语音蜜罐53天采集万通真实诈骗与骚扰通话,含895小时音频及逐轮转录,并验证真实性。
CodeGraph:基于维基数据锚定的源代码开放分类法知识图谱
用代码大模型抽取语义实体并链接维基数据,构建含1.58亿节点、10亿边的源码开放分类知识图谱。