SynthSentry:检测语言模型训练数据中的合成数据污染
提出SynthSentry,无需生成模型信息即可在训练前筛查语料中的合成数据污染,基于词汇多样性、n-gram尾部与困惑度方差评分,并发布工具包。
EAR:面向检索增强生成开发的实体感知分区方法
实体感知分区EAR用于RAG,构建紧凑可检查检索单元,检索词减约38%,准确率变化不显著。
CueMem:面向长期对话记忆的线索引导式上下文重构
CueMem以记忆线索回溯源对话轮,经图扩展重构紧凑证据上下文,提升长期对话问答并降低开销。
我不是谁:面向文本匿名化的风格感知改写
提出风格感知的提示驱动匿名化方法,借大模型构建文体画像改写文本,作者归属F1降60-70%且保持语义。
ORQA:面向大语言模型专业知识的职业真实型问答框架
ORQA对接O*NET职业与权威网站,生成可溯源问答;顶尖模型约六成,医疗最高78%,个别近零。
LifeMem:为LLM智能体实现终身经验复用
LifeMem聚类交互轨迹提取可复用技能,推理时召回相关经验,在10个环境中跨任务迁移并减少遗忘。
《百万窗之家:面向叙事重构的互动小说》
HWAMW以多风格"窗口"重构个人故事,助用户探索意义、增强叙事认同,让AI帮人看见故事潜能。
GraphProfiler:基于个人知识图谱的溯源式敏感属性推断
GraphProfiler将用户发帖历史转为可溯源知识图谱,实现可审计的敏感属性推断并附证据引用。
智能体作为机器人操作的策略
通用智能体无需专门训练即可驱动机器人,凭视觉推理与编程实时修正动作,在多种真实操作任务中取得成功。
SWARM:一个面向搜索引擎结果中俄罗斯宣传检测的多语言人工标注数据集
SWARM数据集:9种语言2183条搜索引擎结果人工标注,用于检测俄宣传。黑名单漏检多,内容级LLM检测最佳。
多模态语言模型中的校准歧义:人类诉诸文化指涉,模型则描述画面
基于Dixit游戏比较人机线索,发现模型存在歧义坍缩与文化扁平化,表达过度具体且少用文化知识。
面向AMD GPU内核优化的大规模数据集与智能体训练
推出面向AMD GPU的HIP/Triton内核数据集与智能体训练框架,微调模型正确率领先。
ZipBench:面向大语言模型综合基准压缩的低成本框架
ZipBench 低成本压缩大模型基准:仅评少量锚模型、合成伪结果并选代表子集,误差0.002–0.02,相关性约0.98。
并非所有语音都是意图:面向ASR后误唤醒的自适应自校正推理层
提出ASCIL后ASR自校正层,融合声学、语言与行为反馈,在线纠错误唤醒并提升接受率。
Meddies-PII:面向临床去标识化的多语言个人可识别信息抽取框架
提出17语9类百万级PII合成临床数据集,经13重校验;模型在15项基准平均F1达0.827,领先。
图上认知:通过认知循环与图—文本双向协同驾驭海量知识空间
提出免训练框架CoG,以规划—探索—反思循环实现图与文本双向协同,在多跳问答上高效超越现有方法。
Doc2FRC:通过固定范围分块实现长度一致的文档级机器翻译
提出固定范围分块(FRC),用动态规划将文档切分到预设长度区间,使训练与推理长度分布一致,显著提升文档级翻译质量。
MedSNIP:构建并基准测试面向医学事实核查的片段级粒度
MedSNIP提出片段级医学事实核查,发布基准与自动切分流程,保留临床结构,减少验证调用并提升假类F1。
DuplexDrama:一个涵盖场景、全双工行为、表现力语音与声音事件的合成对话数据集
首个同时覆盖场景人设、三种全双工行为、情感语音与声音事件的合成对话数据集,超2000小时。
面向波兰语和欧洲语言的参数高效检索器
三阶段训练流程,构建波兰语及欧洲语言高效检索器,无需人工标注,媲美超大模型并开源。
面向大规模多标签文本分类的LLM增强双分支学习
提出DualMLC双分支框架,融合自回归解码器与双向编码器,通过后期融合提升大规模多标签文本分类性能。
以貌取人:清洗大模型真实性评测基准,避免表层特征泄漏
揭示真实性基准中正确答案可被表层特征区分,提出Audit-Prune清洗机制,发布泄漏降至近随机的TruthfulQA。
词更少,并不代表词元更少:按命题衡量梵语的分词惩罚
相同内容下,梵语词少却因分词词元更多;实际部署中每命题词元量为英语1.83–2.90倍。
应用手册上的任务:揭示语言模型长时程程序推理中的差距
提出TAM基准,评测长程程序推理;GPT-5最高准确率仅1%和15.5%,表明现有基准高估模型能力。
Kraken:基于低比特率VQ与双路径源条件的大语言模型语音到语音翻译
Kraken:低码率VQ与双路径源条件,基于Qwen3-8B训练,翻译及说话人/韵律迁移优于基线。
混合专家强化学习中的专家空间探索
ESRL通过扰动专家路由提升采样多样性,保留高置信专家并回放路径,在多种MoE架构与任务上性能最优。
SteerDuplex:可控双工语音对话模型
提出可控双工语音对话模型SteerDuplex及基准SteerBench,经监督微调与两阶段强化学习,显著提升语音风格可控性并改善打断处理。
PRISMA-LLM:面向AI辅助系统综述的实证报告框架
分析888篇综述自动化论文,揭示LLM工作流评估报告缺口,提出PRISMA-LLM报告框架。
类型多样性使Transformer具备组合泛化能力
类型多样性决定Transformer组合泛化表现,词法与结构泛化难度相当,与复合分歧假说相悖。
仅需 Bash 就够了吗?企业数字员工智能体工具接口的实证研究
企业任务中 Bash 优于类型化工具,得分更高且省 token;加工具或 PTC 无增益,合规受限时选 PTC。
SAS:通过端到端优化上下文排序的简单注意力稀疏化
提出SAS门控稀疏注意力,用语言建模损失端到端优化上下文排序,多任务多预算优于基线,紧预算增益显著。
为面向人格感知的大语言模型交互构建原子化用户模型
原子用户模型以人格核心与四层外壳表征用户,按任务检索少量字段,仅用23%上下文即达完整模型文风保真度。
Cortex:内容分析支持软件——质性研究的一种资源
开发Cortex网页工具,辅助质性内容分析,生成索引、指标与类别建议并保留溯源,不替代研究者诠释。
多元心智,分裂网络?基于大语言模型的社会模拟中的人格构成、极化与集体智能
人格构成受控,同次模拟测量极化与集体表现;特质异质性影响最大且对极化两面作用相反,极化不损害集体表现。
继续、适应还是退让:全双工智能体对重叠语音的轮内适应
提出Duplex Cue基准,评估全双工语音智能体的轮内适应能力:人类在协作提示中68.2%会适应,模型仅34.8%。
探究T5规模与显式运动特征对印度手语姿态转文本翻译的影响;T5-small叠加运动特征提升最大,系统列第五。
研究T5规模与显式运动特征对印度手语姿态到文本翻译的影响,T5-small加运动特征提升最大,官方排名第五。
KoSimpleQA:一个韩语事实性基准及对推理型大语言模型的分析
提出韩语事实性基准KoSimpleQA,含938题,最强模型仅31.6%正确,推理可缓解跨语言知识差距。
PA-CDM:面向手写数学表达式识别评估的位置感知字符检测匹配
提出PA-CDM指标,融合字符检测匹配与位置森林编码,构建扰动基准,与人工评分相关性最高。
MP-Bench:评估语音智能体作为多方对话参与者
MP-Bench为首个多方对话语音智能体基准,评测轮流发言与回应恰当性;12个智能体理解率≤22%且轮流近随机,暴露重大挑战。
实体并非生而平等:审视超细粒度实体类型中的长尾问题
仅靠预训练模型参数知识难以处理超细粒度实体类型中的长尾实体,融合知识并超越PLM或是关键。
MAxBench:多类别概念恢复基准
提出MAxBench多类别概念恢复基准,比较10种方法,发现仿射子空间更优,且无方法稳定胜过提示。
UrduFactCheck:面向乌尔都语的智能体事实核查框架——证据增强与基准测评
为乌尔都语提出两个人工标注基准与模块化事实核查框架,融合翻译增强证据检索,评测12个大模型。
教育领域LLM文本检测器的局限性
提出贡献感知框架与GEDE基准;评估发现检测器难判中间贡献文本,尤其LLM辅助修改,易误判,难支撑教育政策。
多语言 LLM 水印真的多语言吗?通过回译将鲁棒性扩展至 100 多种语言
现有水印非真多语言,低资源翻译攻击下失效;STEAM用贝叶斯优化搜索回译语言,增强鲁棒性且可扩展。
语义压缩的统计力学
将语义压缩建模为欧氏空间自旋玻璃,用复制理论得相图,揭示释义与抽象压缩相变;典型情形有高效近优算法。
MMGR:多模态生成推理基准与评估
提出MMGR多模态生成推理基准,覆盖10任务、5能力,揭示视觉质量与推理正确性脱节。
GeoSense-AI:从危机微博客中快速推断位置
GeoSense-AI整合多种NLP技术,从嘈杂微博客流中实时推断地理位置,速度快、F1高,支持应急态势感知与可视化。
翻译腔是对翻译任务难度的理性回应
翻译腔仅部分源于翻译任务难度,跨语言迁移贡献更大;源文本句法复杂度和翻译方案熵预测力最强。
SeDeM:面向长上下文问答的隐藏状态记忆选择性解压
SeDeM:选择性解压隐藏状态记忆,选相关记忆块,仅解压所选块供解码器调用,提升长上下文问答与效率。
ShadowPEFT:用于参数高效微调的影子网络
ShadowPEFT将适配集中为可独立推理的影子模型与层耦合模块,性能媲美或超越LoRA/DoRA。