谁检查引用?法律幻觉检测基准测试
评估AI检测法律虚构引用,GPT-5召回82.8%但难识细微错误,成本与信息访问不平等成挑战。
超越挂钩于世界:指称轮廓与LLM基础化的数值结构
本文提出大语言模型的指称是轮廓化、数值化的,通过优化参数化人类语言痕迹,实现衍生指称。
CAT-Translate:构建日英翻译的紧凑型开源模型
开发小型日英翻译模型,在真实场景中超越多语言大模型,验证了专用翻译模型的价值。
针对AI可见性的每实体偏差映射:为什么品牌提及需要实体特定的校准
提出每实体偏差映射框架,发现品牌幻觉悖论:大品牌虚假引用更高,监管语境加剧虚构。
面向数学错误纠正的教学对齐LLM导师
基于偏好的教学对齐(SFT+DPO)提升LLM数学纠错的事实准确性与教学效果,接近专有基线,但评估可靠性仍存挑战。
小型语言模型在阿拉伯语处理中的评估
评估12个小型语言模型在阿拉伯语任务表现,Gemma 3(12B)最佳,模型大小非唯一因素,对齐和指令遵循更关键。
通过混合自然语言和临床奖励学习实现精确召回可控的放射学报告生成
提出强化学习框架,以控制参数调节临床精确率与召回率,引入临床奖励和组相对训练提升报告生成效果。
解析Agentic RAG:基于本地7B模型的多跳问答组件消融研究
全管道消融表明固定混合检索与短循环优于自适应设计,简单选择显著提升多跳问答性能。
MedHal-Loc:“架构可解释”的医疗幻觉检测器是忠实定位器吗?一个定位基准
检测能力不代表忠实定位;KG三元组流水线定位仅比随机好3.3%,受限于实体抽取覆盖率。
PeerMathDial:面向学生协作数学问题解决的中学对话数据集
首个中学数学同伴协作对话数据集,含55对话6406轮,构建行为分类,分析互动与干预,评估LLM潜力。
专家级评估准则:面向翻译质量评估的案例特定MQM准则
提出案例特定动态MQM准则框架,自适应选择评估粒度与子类型,优于静态准则,提升错误检测效果。
经济转型与文化变迁:以两个世纪的法国戏剧为证
研究显示,资本主义发展使法国戏剧主题从贵族政治转向家庭经济,经济冲击与同伴效应共同驱动文化变迁。
CulMind:中国文化遗产多模态理解与推理基准
提出CulMind基准及ReaScore度量,评估中国文化遗产多模态推理,发现答案与推理存在显著差距,任务自适应评估更贴近专家判断。
大型语言模型中二项式排序偏好的行为与表征证据
LLMs对二项式顺序的偏好与语料分布不完全对齐,偏好强度编码于内部表征,可被操纵。
PrivacyAlign:面向LLM智能体的上下文隐私对齐
通过人工标注数据集和条件奖励建模,使LLM代理的隐私决策更符合人类规范。
大语言模型与人类的表征模式
LLM在语言任务上表现优异,但处理方式与人类不同;在推理学习和泛化上效率低于人类。
TACO:使用大语言模型的任务感知列描述生成
TACO通过三步流程自动生成列描述,提升下游任务性能达32%。
EvoEmbedding:用于长上下文检索和智能体记忆的可进化表示
EvoEmbedding通过动态潜在记忆生成可进化嵌入,实现长上下文检索,超越大模型并加速训练3.8倍。
评估文档调优Transformer表示用于个体心理健康评估
文档调优Transformer在个体心理健康评估中性能提升13.4%,更稳健,能更好捕捉不确定性。
使用开源小型语言模型的临床术语提取
比较26个开源小语言模型提取ALS临床术语,正则基线最优,混合方法更佳。
压缩何时有益何时有害:思维链蒸馏的条件感知分析
通过重要性标准、重组级别与压缩预算三维度分析,发现步级标准共享推理骨架,重组对数学有害但对通用任务去噪,训练压缩未必节省推理成本。
CuratorKIT:面向LLM后训练的数据策展与合成数据生成
CuratorKIT开源库实现LLM后训练数据完整策展管线,含数据卫生、合成生成、质量过滤与可审计溯源。
逆图灵基准:评估语言模型作为人机对话的判官
逆图灵基准测试发现,GPTZero等模型区分人机对话准确率高达89%,统计方法有语义盲区,语义方法易受角色提示影响。
基于下一标记预测的测试时训练
提出TTT-NTP方法,用模型自身下一隐藏状态监督测试时训练,提升长上下文性能并保持常识知识。
语言-能源鸿沟:衡量多语言大语言模型推理的能源成本
多语言LLM推理能耗差异最高达179倍,源于脚本复杂与token数多,高能耗语言准确率低,建议将能源纳入评估。
固定RAG压缩使读者缩放测量崩溃
固定压缩提升平均准确率,但掩盖读者进步、颠倒模型排名,弱读者受益而强读者受损。
去噪迭代自校正:结构化验证循环实现可靠LLM推理
提出DISC方法,通过迭代验证-判断-纠正减少错误,控制精度显著提升推理可靠性,缓解自确认偏差。
利用LaBSE与渐进式课程学习进行多文化极化检测
利用LaBSE嵌入和渐进式课程学习检测多文化极化,低资源语言F1提升0.2。
CalVerT:利用校准验证器遥测增强智能体,改进知识密集型任务中的行动与学习
CalVerT通过自置信度和验证器评分增强智能体状态,减少错误和冗余检索,提升问答准确率。
无键注意力:面向高效Transformer的值空间路由与仅值缓存
提出无键注意力,消除键投影,仅用查询和值,KV缓存减半且性能匹配或超越标准注意力。
TALAS: 面向嵌入蒸馏的教师锚定层对齐与自适应锐度感知最小化
TALAS通过教师锚定层对齐与自适应锐度感知最小化,高效蒸馏句子嵌入,提升泛化并降低计算成本。
何时规划,何时精修:噪声水平作为扩散语言模型的粒度轴
NDGC利用噪声水平动态调整粒度,高噪声用词簇规划,低噪声逐词细化,实现从粗到细的单级扩散,提升结构质量。
LLMs能否控制可读性?面向CEFR可控阿拉伯语生成的多维评估框架
提出CEFR可控阿拉伯语生成的多维评估框架,发现结构化提示加词汇约束显著提升可读性对齐与预测一致性。
Which Review Aspect Has a Greater Impact on the Duration of Open Peer Review in Multiple Rounds? -- Evidence from Nature Communications
多示例上下文学习在命名实体识别中提升性能与低资源标注
多示例上下文学习使大语言模型在NER上匹配甚至超越全监督BERT,并用少量标注生成高质量数据,低资源NER性能提升约10%绝对F1。
受嗅觉启发的稀疏组合编码用于低资源命名实体识别
受嗅觉启发的稀疏组合编码作为正则化器,在低资源NER中提升F1,尤其在孟加拉语和泰卢固语上显著。
MindTailor:基于发帖历史案例构建与协作优化的个性化情感支持
利用用户发帖历史构建案例,多咨询师协作优化回应,显著提升共情与个性化水平。
更深并非总是更好:通过自信层解码缓解对齐代价
提出自信层解码动态选择最可靠近最终层,避免扰动,零内存低延迟提升推理性能。
多语言模型真的在进步吗?分离真正的跨语言迁移
提出硬度调整迁移评分,发现小模型迁移不差,但随规模增大进步慢,随时间有进展。
基于软目标注意力探测的大语言模型预生成幻觉检测
提出预生成幻觉检测的软目标注意力探测法,通过随机采样估计错误率,实现高质量风险估计。
超越价值基准:通过对称Q分类法测量大型语言模型中的价值结构对齐
提出基于Q方法的对称评估框架,测量LLM价值结构对齐,揭示模型间异质性和局部偏差。
OpenBioRQ:面向代理的未解决生物医学研究问题
OpenBioRQ基准含12553个无答案生物医学难题,发现代理模型15.9%引用错误,难题中工具使用崩溃,需提升忠实性。
词汇共识:人工智能体中的具身词汇学习与共享意义
提出词汇共识框架,发现感知距离主导词汇获取而非语义距离,命名与检索机制不同。
大语言模型在字素音素转换中的基准测试:日语案例研究
对30多个大语言模型进行日语字素音素转换测试,最佳模型字符错误率0.52%,优于传统工具。
NL2Scratch:面向积木式编程的可执行基准与评估
NL2Scratch基准与SAC指标揭示模型词法高匹配但语义对齐不足,错误集中于操作槽
为高性能多语言ASR添加鲁棒语码转换能力
提出贝叶斯因子化适应,仅需少量合成数据,语码转换转录错误降低32.87%,WER改善5.31%,保持单语性能。
从识别到理解:用大语言模型解锁认知时间序列推理
提出TSCognition基准与TSAlign框架,通过多模态对齐提升时间序列认知推理,优于现有方法且计算成本更低。
信号何处寻?医学编码器预训练的网络数据配方
提出术语密度过滤与信号增强重写策略,构建法语医学预训练语料FineMed及DoctoBERT模型,显著提升下游任务性能。
黑盒大语言模型分类中的分数粒度差距:置信度构建方法的比较研究
比较七种置信度构建方法,发现单次口头置信度粒度粗,多查询聚合帮助弱模型但可能损害强模型,提供部署指导。
语言技术的多元化——下一代AI中的文化整合
文化对齐需多元认识论而非仅增实例,NLP方法仍不全面,需反思性社会技术路径。