从标注验证集输出统计量预测推理时间缩放收益
基于标注验证集三核心特征加熵的预测器,可高精度预测最佳-of-N推理增益,实现低成本配置筛选。
引导提示的多样化策略优化用于大语言模型推理
提出HDPO方法,让模型先列候选方案再选最优,分两阶段训练,提升推理多样性与可靠性。
深思错觉:多智能体LLM讨论中的事实衰减与立场同质化诊断
多智能体讨论中最多丢失72%关键事实,立场趋同但知识减少,共识可能误导。
PhotoCraft:基于分层自进化记忆的深度图像搜索智能推理
PhotoCraft是无训练的分层记忆系统,通过工作、情景、语义记忆提升图像搜索准确率,最高达18.5%。
SEA-Embedding:面向东南亚的开放可复现文本嵌入
提出SEA-Embedding,面向东南亚语言的开放可复现文本嵌入管道,仅用公开数据实现SOTA。
Hallucinations as Orthogonal Noise: Inference-Time Manifold Alignment via Dynamic Contextual Orthogonalization
研究者指定协变量下基于LLM文本分析的条件假设生成
引入协变量指导LLM发现子组差异,解决层不平衡与符号反转,提升假设有效性。
G^2C-MT:面向文档级机器翻译的图引导上下文选择
提出图引导的上下文选择方法,通过深度偏置随机游走采样结构路径,提升多领域文档翻译性能。
LLM评判者的几何学:为何LLM间共识不代表人类对齐
LLM评判者间共识强但与人一致性弱,几何分析显示两者得分子空间近乎正交,共识非对齐。
大型语言模型中的事实性观点可以被编辑(操纵)吗?
引入事实观点编辑基准,发现现有技术仅表层修改,新方法实现观点与证据对齐。
遗憾预训练:桥接先验与后验视角以增强知识根基
遗憾预训练利用未来信息改进因果语言模型,无额外参数,平均准确率提升3.7%,BoolQ提升18.1%。
MemTrain:自监督上下文记忆训练
MemTrain通过掩码重建和记忆召回代理任务自监督增强LLM代理上下文记忆,下游性能提升最高17.67点。
大型语言模型中词汇对齐与偏好阶段转变的全自动识别
提出两个自动评估指标,识别LLM词汇过度使用及偏好学习关联,方法可扩展。
DMT-CBT:面向CBT咨询的纵向治疗状态建模
提出DMT-CBT框架,跨会话多模态动态建模治疗状态,显著提升咨询 fidelity、治疗联盟及情感轨迹。
一个包含中文俗名和CITES来源链接的跨领域热带物种数据集
跨领域热带物种数据集含41万余种,中文俗名覆盖99.5%,并关联CITES来源链接。
一致性最大化提升多元价值对齐
ICM通过生成连贯示例,无需监督即可对齐多元价值观,且一致性比准确率更关键。
小强化学习控制器,大语言模型:强化学习引导的测试时扩展自适应采样
用强化学习训练轻量采样控制器,平衡正确性、延迟与成本,实现测试时自适应采样。
基于经验的强化学习驱动的大语言模型动态退出策略
LEDE框架利用离线强化学习动态选择退出层与推测长度,实现LLM推理2.0-2.7倍加速,比静态推测提升17%。
HyperPatch:n元结构漂移下的顺序知识编辑
HyperPatch将顺序知识编辑重构为超图流形稳定性问题,通过三阶段方法解决n元结构漂移,大幅提升准确率。
SenseJudge:以人为中心的偏好驱动评判框架
提出SenseJudge框架和SenseBench基准,以人类偏好驱动评判,在个性化评判与模型排名中优于现有方法。
AI评分者区分能力取决于复杂临床决策中的评分协议
AI评分者区分力取决于评分协议,带患者特定标准可放大差异,无标准则抑制区分。
SEA-NLI:将自然语言推理作为理解东南亚文化的透镜
引入SEA-NLI基准测试,发现所有模型在东南亚文化推理中表现差,失败源于文化知识缺失,文化适应与提示可提升效果。
语音到语音翻译模型基准测试
COMPASS框架整合46指标评估S2ST,过滤至10个,揭示单一指标有误导性,领域指标更符合人类判断。
非洲语言NLI评估的样本量扩展研究
非洲语言NLI性能与样本量非线性相关,语言敏感且方差大,数据量不足以保证稳定收益。
ARBOR:面向搜索代理的在线过程奖励与可复用评分缓冲池
ARBOR通过共享评分缓冲池为搜索代理提供在线过程奖励,将零梯度训练组转化并提升准确率。
WebRISE: 面向MLLM生成网页的需求引导状态评估
WebRISE用交互契约图评估MLLM生成网页,14个模型中最强仅66%需求覆盖,视频交互信号最优,错误检测率是传统方法的2至16倍。
结构促进检索、重排序和生成
提出SF-Re2G方法,利用文档结构改进检索、重排序和生成,在对话系统中提升性能。
The Word and the Way: Strategies for Domain-Specific BERT Pre-Training in German Medical NLP
复杂性调节何时有助于冻结句子嵌入?关于单句难度与句子对难度适配的受控研究
单句复杂度无益;配对难度门控在STS-B(+0.022 Spearman)和QQP(+0.037)有持续提升,本质为重排序器。
超越“敬启者”:根据受众和意图定制机器翻译
评估50语言下目的驱动翻译:明确指令显著提升适应性,传统指标失效,模型自生成指令填补80%差距。
使用Transformer建模计数器语言中堆栈表示的因果证据
通过线性探针和消融实验,证明堆栈表示对模型性能具有因果必要性。
大语言模型中的多语言遗忘:迁移、动态与可逆性
多语言遗忘因语言相似性而异,主要作用于解码层抑制而非擦除知识,一次推理方向调整可恢复50%-90%遗忘知识。
Evaluating LLMs' Effectiveness on Real-World Consumer Device Repair Questions
SagaQA:电视剧长篇叙事理解的多跳推理基准
提出SagaQA基准,评估跨剧集多跳推理,混合规划策略效果最佳。
Beyond Ideal Instruction: A Comprehensive Framework for Evaluating LLMs in Realistic Interactions
从脚本到语义:非洲自然语言推理的提示策略
对比提示策略在非洲低资源语言NLI中最可靠,精心构造提示优于带示例和思维链基线。
EntSQL:在长上下文企业知识中实现Text-to-SQL落地的基准
提出企业导向的Text-to-SQL基准EntSQL,含1066个跨领域示例,复杂SQL,最佳准确率仅15.9%。
Lingo研究小组在SemEval-2026任务9:评估极化检测的提示变体
评估12种提示变体,基于Gemma3-27B,跨语言粗粒度极化检测有效,细粒度多标签分类困难。
未取样的真相:SLM心理测量衡量的是提示伪影,而非心理构念
SLM心理测量中提示伪影常压倒语义信号,模型反映提示遵从而非心理特质,新框架可诊断伪影。
观察、推断、干预:面向目标导向社会智能的主动世界建模
提出SII框架与PIWM模型,构建零售基准,发现视频到状态映射为部署瓶颈。
通过幻觉拒绝采样构建可靠的长文本生成
提出SHARS框架,用幻觉检测器拒绝生成中的幻觉并重采样,有效减少长文本幻觉积累,提升事实一致性。
语言转换是否会破坏医学视觉语言模型?——印尼放射学视觉问答案例研究
印尼语版放射学VQA测试显示,医学VLM在非英语场景性能下降8-25%,凸显多语言评估必要性。
AutoTail-BSFGM:面向中文学术文本分类的类别平衡感知微调方法
AutoTail-BSFGM通过门控尾部调整与对抗正则化提升中文学术分类的类别平衡准确率。
大型语言模型对自己的回答过度自信
发现聊天模板引发所有权偏差,模型对自己回答的置信度高出26%,伪装输入可提升校准达26%。
超越字面:多模态模因理解中的语用意图分解
提出Intent Projection框架,从表示、输出和目标层面分离字面与语用,显著提升多模态模型理解模因的准确性。
BaltiVoice:巴尔蒂语语音语料库与微调Whisper ASR系统
构建16.8小时巴尔蒂语语料库,微调Whisper-small使词错误率从182%降至30%,数据集和模型已开源。
面向隐私保护的大语言模型临床部署的选择性令牌级密码化编辑
HERALD框架通过选择性加密敏感标记,在保护隐私的同时保持模型效用,性能接近明文。
CoEval:无需标注数据或可信基准,对自定义任务的语言模型进行排名
提出CoEval框架,通过合成新基准与跨族法官集成,无标注、无污染地廉价排名模型,准确恢复真实排序。
微调大语言模型的安全度量应基于能力
微调模型安全度量需基于能力,发现安全输出不连贯、自动评判不可靠、结论因基准而异。
语言处理中的词典与语法:工业化生产还是手工制作?
探讨手工与工业化构建词典语法的优劣,分析实例并讨论最佳路径。