子词词表的显式边界标记
用显式词边界标记替代空格避免子词重复;虽未改善分词压缩,但语言建模性能更好,每字节比特更低。
临床对话中的测量:可观察的阶段结构与部分可观察的患者状态
对话阶段结构可观察,患者状态仅部分可观察,警示仅凭转录推断人类状态不可靠。
视频中介对话中不同伙伴可见性条件下的多模态信息性研究
研究发现手势可预测指称,多模态融合有助提升,伙伴可见性影响手势产生与信息性。
不要回溯:面向流式对话摘要的缺失证据记忆
流式对话摘要需从无限历史中提取证据补齐当前窗口缺失信息。提出ReMEMBER框架,按依赖检索并精炼记忆,在固定预算下提升证据召回与缺口补全。
绑定三元平面:将PTQTP约束为均匀九级量化器,并采用持久折叠格式用于磁盘流式专家混合服务
将PTQTP三元平面约束为均匀九级量化,折叠成持久4位格式流式服务MoE,质量不变且更快更小。
同一个问题,不同的答案?衡量并缓解提示特权以实现AI公平访问
提出提示特权并度量,用PET转换消除性能差异,实现公平AI访问。
基础模型对婴儿信号的迁移程度如何?基于统一需求本体的跨数据集迁移审计
四语料审计显示单语料评估易误导,跨库迁移多为负,但统一本体联合训练有效,噪声库迁移为正。
ELICITED:基于电子健康记录的纵向交互对话,用于信息获取的分诊评估与决策
提出急诊分诊对话生成框架,基于电子健康记录数据集,支持信息询问、证据使用、五级分诊预测及医患沟通评估。
修辞如何钻AI审稿人奖励机制的空子?——解析AI同行评审中的修辞敏感性
修辞可影响AI评分:证据框架与新颖性作用最大,低分升高分降;复杂改写收益有限,严格审查不改变敏感性。
Social Gym 与 SPaRTan:基于多智能体游戏锦标赛的大语言模型社交推理基准测试与改进
提出Social Gym多智能体游戏基准与SPaRTan免训练自我提升法:可提升GPT-5-mini,但对Qwen3-32B无效。
经验之树:面向自进化智能体的层级经验管理
提出经验之树(ToE)框架,将经验组织为层级推理树并用环境反馈校准,显著提升复杂推理的准确率与效率。
当信心失效:不确定性与临床信息缺失下大语言模型的过度自信
临床信息不确定时,大语言模型准确率下降但过度自信,不安全自信错误大增,甚至虚构答案。
LexKairos:评估大语言模型的法律时间能力
提出LexKairos基准,测试中文法律场景下LLM的时间能力,含三维度九子任务,发现最优模型仍有明显局限。
宣告即线索:标记、边界与预训练语料库的记法
测量表明长无标记文本稀缺;删结构宣告降预测性,符号无关;模型不加宣告。建议记录提取器与存活率。
Evo-Bench:语言模型能否改进智能体框架?
首个评估智能体框架进化能力的基准Evo-Bench,采用辅助任务进化与敏感分层,顶尖模型绝对提升达16.6点。
测量分词溢价:对服务不足语言社区的成本审计
研究发现分词不平等造成成本和功能壁垒,孟加拉语等需更多token,呼吁将其视为公平基础设施。
弥合语义与重建间的鸿沟:统一手语翻译与生成
提出Uni-SLTP统一手语翻译与生成,共享符号分词器与自回归模型,兼顾语义与重建,性能优。
基于大语言模型的主观多偏差检测
研究用大语言模型识别文本中的主观偏差,涵盖框架、认识论、人口统计三类,并检测判断是否存在。
从移动应用评论生成安全与隐私分类法
提出TaxoScale,从60万条应用评论中自动构建安全隐私分类法,超越现有基线并发现新分支。
揭示文本分类器虚假捷径的自动发现与因果验证
提出全自动流水线,无需人工标注即可发现并因果验证文本分类器中的虚假相关,通过反事实干预缓解偏差,提升分布外准确率。
用于结直肠癌治疗规划的智能体生成式大语言模型
提出GatorOnco智能体大模型,结合领域适应与检索增强,在结直肠癌治疗规划中达专家级水平,优于开源模型。
跨语言迁移中通用还是语系特定文字统一?突厥语族案例研究
突厥语族语言中,通用罗马化与语系文字统一均优于基线,NER无显著差异;POS结果取决于子词覆盖与监督。
EmoS:基于理论框架的语音语言模型情商评估与对齐框架
基于理论框架提出EmoS基准与模型,语音情商评估从52.6%提至83.8%,接近人类水平。
故障感知的长文本翻译:可恢复LLM翻译系统的设计与实现
提出可恢复LLM翻译系统:延迟释放、校验输出、类型化流事件区分替换与续写,失败有回退路径,通过38项测试。
UNSPECIFIC:打破大语言模型指令遵循中复制粘贴捷径的通用约束合成
提出新框架合成两相似文献共性约束以减少复制粘贴选择性加固易满足约束并在原文及摘要上评估抑制浅层遵循
在言语决策展开中解读认知:因子化逆决策模型
提出因子化逆决策模型,从言语转录中分离行动与努力因子,在老年购物任务中提升认知状态分类。
基于可验证依据的月球地质机器解释
将地质推理嵌入多模态模型,从地图生成可验证的月球地层解读;视觉定年需检索文献。
准确但自然吗?诊断日本英语学习者写作中的语法与惯用差距
分层LLM纠错流程区分语法与地道性,基于3830篇日本初中生作文量化准确与惯用差距,提出教学分类。
ACL的负责任NLP检查表是否只是走过场?——对EMNLP 2025的大规模分析
分析2025年EMNLP检查表伦理边缘化近半理由空泛部分矛盾逾半忽视风险建议设字数下限与风险审查
减少扩散语言模型预训练与生成不匹配
提出前缀条件扩散预训练目标,缩小训练与生成差距,基准测试平均提升4.2%。
通过语言强化学习实现大语言模型个性化的偏好适配
提出免训练元学习框架AlignXada,用语言强化学习将通用偏好摘要精简为任务特定视图,平均提升3.82分,仅保留22.8%原词元。
意图胜于言辞:超越响应模仿的可控用户模拟
UserIDA将交互意图设为每轮显式指令,与语言生成分离,通过强化学习校准,意图准确率远超基线。
法律RAG中的时间性错误锚定:法国税法的版本化语料基准
揭示法律RAG时间错位,构建法国税法版本化基准,现有模型静态检索适用版本成功率为零,新方法达98.3%。
ZetaGPT:无位置编码的状态空间注意力语言模型的参考实现
提出无位置编码语言模型ZetaGPT,用因果状态空间方程隐式编码位置,并开源完整训练流程。
语用攻击面:大语言模型中隐式上下文的脆弱性
利用隐式语用上下文可绕过安全对齐,形成大模型攻击面,攻击成功率显著提升。
Mawqif-v2:用于跨目标立场检测的阿拉伯语基准数据集
发布Mawqif-v2扩展集,含996条人工标注阿拉伯语推文,用于评估跨目标立场检测泛化能力,并提供基线结果。
TCS-BENCH:基准测试最先进的生成式AI理论计算机科学研究能力
提出TCS-Bench基准,评估大模型在研究级理论计算机科学证明生成上的能力,验证器与专家判断高度一致,准确率超90%。
构建、攻破、重复:评估与改进社交媒体中LLM操纵的虚假信息检测
提出构建-攻破-重复迭代框架:攻击达95%翻转率,防御准确率72.68%,暴露弱点并提升鲁棒性。
ELBench:面向教育的大语言模型多维度基准
新基准统一评测教育大模型四维能力:安全与教学负相关,国产安全领先,教育专用无优势。
MDB-Link:多数据库文本转SQL的分层模式链接
提出MDB-Link分层模式链接框架,先全局索引检索列,再聚合证据筛选库,最后用预算感知LLM精排选表选列,在三个基准上显著提升SQL生成准确率,且速度更快。
测量错误之物:内部危害性分数反向排名成功越狱
内部危害分数衡量意图而非越狱结果,包装后攻击成功率上升但评分下降,成功越狱被排到失败之下。
Cultivar: A Contrastive and Locale-Oriented Translation Benchmark for Investigating Contamination and Localisation Robustness
大型语言模型如何评判社会吸引力?来自多模型与人类基于理论人设评分的证据
研究大型语言模型如何评估社会吸引力:基于理论人设,多模型评分稳定且分级一致,但与人类相比更极端。
Se-DPO:用于直接偏好优化的自演化令牌信用
提出自演化令牌信用,动态分配,依据强度与置信度校准,无需外部模型,提升直接偏好优化。
英美电影音频描述对比
基于206部电影语料,量化验证英美音频描述在词汇、语法、命名、场景提示及与对白音乐重叠度上的差异。
REFRAMED:迈向电影真实音频描述生成
提出描述内容与时机联合决策的音频描述生成任务,构建含2023个视频片段的REFRAMED数据集,现有系统远不及人类专家。
KGCaRe:利用知识图谱自动构建与上下文检索的 LLM 可解释复杂条件问答
提出KGCaRe混合方法,结合神经检索与知识图谱符号推理,显著提升复杂条件问答准确性与可解释性。
PragMatch:在大规模视觉-语言模型中区分语用不协调与跨模态不匹配
提出PragMatch基准,揭示LVLM依赖表面线索而非真正推理,将语用不协调误作跨模态不匹配。
用于音频-发音实时MRI语音分类的结构化音系表征
结构化音系特征可提升实时MRI音频-发音分类,改善音素识别,音频监督可部分迁移至发音轮廓模型。
SWE-Bench ProMax:面向大规模多语言代码重构的智能体基准测试
提出多语言代码重构基准SWE-Bench ProMax:170个实例,平均改11.4个文件,最强模型解决率仅41.2%,极具挑战。