生成式与编码器模型在多语言NER上的对比:Naamapadam实证研究
编码器模型在11种印度语言NER上大幅优于生成式,差距达7.5-40个百分点,少样本最佳仅达编码器基线28%。
高产卖家如何自我呈现:剖析160万条Reverb列表的沟通模式
基于160万条乐器列表,高产卖家更重客观功能、少主观音色,语言叙事化且多用第一人称,描述更长。
进化汤:面向多目标大语言模型对齐的演化专家混合方法
提出进化汤,用进化算法训练门控网络的专家混合框架,动态融合专家,提升多目标对齐的帕累托前沿,性能优于基线。
DataFoundry:通过递归自我改进演进数据准备器
递归自我改进演进数据准备器,以技能模块架构修正构建缺陷,在多领域提升下游效用且跨模型稳健。
生成保留认知构念的临床病例摘要
提出一种理论框架,将认知模型编译成图生成临床病例,保留因果链,效果优于零样本,减少人群质量差异
超越流利度:基于评分标准的大语言模型沙特方言与文化能力评估基准
沙特方言基准:31提示,4模型42.7-53.1%,均未超55%,主错模糊框架而非幻觉,数据开源。
SciReC:自适应交互下多模态多轮关系推理的诊断性评估
提出科学推理基准与缺陷诊断框架,评估多模态大模型关系推理,发现主要错误源于关系推理和记忆。
基于向量索引的输出嵌入加速LLM推理
以向量索引检索替代稠密输出投影,只取少量高概率词,单批解码吞吐最高提升82%,质量不变。
语言模型评分准则引导的强化学习综述
评分准则引导的强化学习综述:以结构化标准替代标量奖励,提出贝叶斯分类,分析粒度、语义漂移和奖励攻击。
情绪背景对大型语言模型支持仓促决策的影响:六款商业模型情绪脆弱性比较
情绪表达显著增强AI对仓促决策的支持(+12.9分),与对话长度无关;六模型中五款受影响,旗舰模型也未能幸免。
UIC-AIHealth4All在ArchEHR-QA 2026:以答案为先的临床问答证据锚定
提出答案优先的证据识别与生成管线,自一致性投票对齐,证据识别第三,生成第九,对齐第五,输出可读性低于临床参考。
XHotpotQA:多跳问答中跨语言知识组合的基准
XHotpotQA基准用于多跳问答跨语言知识组合,含证据依赖图与语言分配,验证显示问答错配显著降低F1,提供诊断与评估。
重锤还是手术刀?面向隐性仇恨言论的细粒度自适应框架
提出FAID:先细粒度分类,再对浅层、定向、语境依赖三类自适应推理,省算力且性能领先。
选择而非训练:基于LLM选择的模块化实体消歧的益处
将实体消歧分解为检索与选择,用LLM选择器时训练检索器收益甚微;无训练BM25+LLM在ZELDA达SOTA,支持弃权时F1达90.7。
INSPIRE:示例驱动数学推理的“先内化后提升”方法
提出INSPIRE方法,通过参考引导内化和分阶段偏好训练,提升LLM示例驱动推理,超越更大模型且不损害通用能力。
PACE:基于智能体自动化的发布者自适应内容提取
PACE智能体学习发布者配置,推理免大模型调用,高效提取文章、元数据、图像等,优于非手动基线,接近人工解析器。
从线性距离和相似性感知熵的视角看LLM中的句法表示
基于线性距离和相似性熵,预测句法关系重构准确率,揭示LLM句法表示的抽象性。
扩散语言模型的轨迹级投机解码
提出轨迹级投机解码,利用置信分层树探索与块并行验证,减少30-40%迭代,速度提升7-14倍,精度损失小于1%。
线性探针如何涌现?基于概念定向归因的电路追踪框架
提出CTA框架解释线性探针内部电路,图特征预测准确率,因果消融区分探针与输出机制。
知道再回答:解码语言模型实现可靠RAG
研究利用模型内部信号判断RAG证据是否充分或冲突,轻量线性分类器优于提示方法,可可靠用于RAG分流。
当分词器失效:面向低资源语言零样本迁移的字节级分块
提出适配层级网络,从冻结子词模型初始化字节嵌入,用分块对齐损失和词性监督,零样本迁移至低资源语言,词性标注提升13.3%。
低于噪声底限:小模型知识蒸馏中的双峰坍缩与不同失败模式
小模型KD单种子评估不可靠:种子方差大、多方法双峰坍缩,且存在错误选函数与输出截断等失败模式,仅渐进式与排名式稳定。
先使其可玩,再使其优秀:小型对话游戏智能体的分阶段交互学习
提出2B对话游戏模型:先模仿成功轨迹保可玩,再用加权回合与教师引导提决策,Playpen第二,已开源。
音视频大语言模型中的组合失败:跨模态冲突下的后期层先验主导
研究音视频冲突下AV-LLM组合泛化,发现后期层先验主导致失败,VideoLLaMA 2近乎随机,InternVideo2下降32.3%。
信息反局部性与大语言模型中的局部性偏差
大语言模型能学会反局部语言,损失相当,但越反局部收敛越慢,说明非局部依赖更难学,偏差在速度而非成败。
承重上下文:评估语言推理中上下文依赖的问题损伤评分
基于问题损伤评分的诊断框架评估上下文依赖:删除承重示例后,前沿大模型很少弃权,常仍答对。
PersonaEdit:用于个性化模型编辑的代表性样本选择
提出PersonaEdit聚类抽样法,减少编辑样本量且保持性能,结合检索增强可提升LLM个性化效果。
EvoHarmBench:用迭代式类人规避突破内容审核
首个动态对抗评测框架,迭代优化语义簇级规避并兼顾可读性,揭示商业审核系统攻击成功率达80.3%
合成语言能动性:具身可朽智能体如何通过有后果的社会经验习得语言可供性
定义合成语言能动性,构建具身可朽智能体,从影响存亡的社交后果中学习语言,表达受身体历史塑造并改变伙伴行为。
OpenStamp:面向开源语言模型的水印技术
OpenStamp将水印逻辑编入模型末层投影,抗改写与微调,性能损失小。
AI写作者具有一致的文体学足迹,而AI编辑则没有
AI生成文本有稳定的文体足迹(熵与词汇多样性),但AI编辑不呈现此特征,二者应分开研究。
LandingAgent:面向落地页的参考标注数据集与智能体生成框架
提出参考标注数据集与智能体框架,参考真实页面生成落地页,提升目标契合度与布局多样性。
智能体记忆如何助力可靠处理不可回答问题?
记忆可提升不可回答问题处理,但增益有选择性且易受数据集漂移影响;跨模型复用优于跨数据集,决策引导优于轨迹塑造,程序性记忆最可靠,关键在可迁移指导而非经验量。
QUORUM:使用多标注器的质量优化路由
QUORUM:预算感知路由,按实例分配人或LLM标注,多标注聚合,质量提升34.4%,成本降8.8%。
韩语谓词形态中词汇条件引发的实现歧义
韩语中相同词干词尾配置可因词汇身份产生不同表面形式,需靠词汇义与实现类确定,揭示纯形态表征的局限。
实体记忆图检索提升长对话问答中的证据覆盖
在LoCoMo十段对话1986问上,图检索将top-25证据召回从79.75%提至84.48%,但最终答案F1无显著差异。
H-Scale:面向NVFP4亚字节LLM推理的Hessian引导缩放因子精调
提出H-Scale轻量后处理方法,用二阶代理优化NVFP4分组缩放因子,零推理开销,提升主流LLM量化性能。
基于语言模型的古代文献文本修复
研究表明语言模型可辅助修复古代文献缺字,但无法全自动,效果因内容和缺字长度而异。
SimpCue:基于线索提示的多语言文本简化
研究发现预测线索提示略优,但收益有限且因语言和指标而异
超越全局标量:融合词元级统计与深度语义的对抗性AIGC文本检测
提出NeuroStat框架,融合词元级统计与深度语义,利用宏状态残差调制增强鲁棒性,在对抗基准MOSAIC上表现最佳。
CNeo-Bench:面向中文新词的大语言模型诊断基准
构建4759个中文新词基准,评估18个LLM:多数定义生成低于40%,存在识别-操作鸿沟;少样本提示可解部分难题,但错误仍多。
孪生世界:面向证据支撑推理的基于等变性弃权
提出孪生世界,以实体替换构造多重世界,用等变性违反作弃权信号,检测推理是否基于证据,提升可靠性。
FinExam-10K:检索何时助力金融推理?
发布FinExam-10K金融考试基准:10198题,最佳85.29%;检索增益微,门控提升至71.23%。
多方对话中的话轮转换结果预测:结合人际亲密度的语音与目光动态可解释建模
结合语音响度与目光特征,可解释模型预测四人对话话轮转换,AUC达0.76,目光在噪声下仍稳健。
颤抖的声音未必是回避:财报电话会议中文本与语音回避检测的基准测试
提出双维回避基准,含六十场财报会议五百零五问答,标注文本回避与语音信心;多模态模型难测语音信心,与人类差距大。
嵌套字节级词表:部署廉价,共享昂贵——一项预注册的阴性结果
嵌套BPE可切片部署,但共享模型逊于固定专家(32k差3.64%,8k差2.96%);控制令牌无效,输出限制主因。
滑动窗口优于线性注意力
滑动窗口注意力搭配sink节点,性能不输甚至超越后训练线性注意力模型,在长上下文任务中优势巨大,且无需后训练、成本极低。
用于立场感知论证检索的嵌入模型
现有模型偏重主题忽略立场,对比训练易过度校正;用平衡课程与LLM增强反向论证,提升立场感知检索。
当大型语言模型的语言自信与内部自信相背离时
研究发现大模型的语言自信与内部自信常不一致,属有损通道,需多维度评估。
CultureConverse:面向东亚与东南亚文化情境辅助的多语言多轮模拟评估框架
提出CultureConverse多语言多轮模拟评估框架,覆盖10个地区58个子群体,含14.6万评估片段,评估18个模型,微调可提升文化能力。