学习路由语言以实现多语言策略优化
提出LRPO框架,通过多臂赌博机自适应路由语言,提升多语言策略优化的训练效率与性能。
AI-Associated Lexical Shifts Across 34 Languages: Cross-Lingual Convergence and Diachronic Uptake in News Writing
面向不确定性的主动应对:语音对话系统中的原因感知错误诊断与交互式澄清
提出原因感知错误诊断,区分三类错误,实现多轮澄清,WER降低30%、下游任务提升17%。
高效图RAG:面向跨任务检索增强生成的结构化检索状态管理
EfficientGraph-RAG通过TAM、MARS、SMP三个机制显式管理检索状态,在多项基准中取得最优答案质量,并大幅降低大模型token用量。
GeoMathCode:理解几何问题求解中交错的数学-代码推理
GeoMathCode以程序表示作为中间输出,分析几何推理,发现推理与代码生成在潜在空间可解缠,代码结构含更丰富数学符号信息。
AuthTrace:诊断主题密集单一作者语料库中的证据构建
AuthTrace基准发现证据召回率是答案质量关键(r=0.96),扇入梯度揭示不同证据系统的退化模式。
索马里基准评估:测量开源大语言模型中英语到索马里语的拒绝差异
评估四个开源模型发现,英语与索马里语有害提示的拒绝率存在显著差距,非拒绝输出多为模糊内容。
LLM作为审稿人:评估其能力、分歧及对提示注入的抵抗能力
LLM审稿测试显示:高估弱稿、偏离人类判断,易受隐藏指令攻击,需防范偏差与对抗风险。
MATO:面向大语言模型的测试时优化多目标个性化对齐
MATO通过测试时优化,无需训练即可动态调整多目标权重,实现大模型个性化对齐。
面向高效大语言模型的通用张量结构压缩方案
MixT是一种通用张量结构压缩方案,在LLaMA2-7B上实现47.5%参数和37.1%推理FLOPs的减少。
多智能体LLM框架用于评估手术反馈质量
提出多智能体LLM框架,自动发现手术反馈评分标准并评分,效果优于此前方法。
HyLaT:通过混合潜在-文本协议实现高效多智能体通信
HyLaT提出混合潜在-文本协议,结合效率与可解释性,两阶段训练降低通信开销并保持任务性能。
好奇心时代遇上AI时代:大型语言模型的儿童安全基准评测
提出KIDBench基准,评估7-11岁儿童使用LLM的安全性,单/多轮测试显示年龄提示提升安全得分,跨语言表现不均,并推出专用评估和响应模型。
多样性的和谐:面向大型推理模型的多域对比策略优化
提出MCPO,通过对比学习促进跨域知识共享与域内整合,提升多域推理能力。
GeoSVG-RL: 几何感知强化学习的布局约束文本到SVG图表生成
提出GeoSVG-RL强化学习框架,用几何反馈优化布局约束SVG生成,显著提升结构可靠性。
TypedCSIP: 面向中国立法冲突分类的类型化反事实预训练
TypedCSIP利用专家修订作为反事实监督,两阶段训练提升冲突分类F1,在LCR-CN上超基线0.9-1.3个百分点。
轻量级混合Transformer-CRF架构用于多类型孟加拉语医学实体识别
提出轻量级孟加拉语医学实体识别框架,通过知识蒸馏和量化实现高效率部署。
IndexMem:面向长上下文LLM推理的基于学习的KV缓存驱逐与潜在记忆
提出可学习索引器与潜在记忆模块,精准保留关键令牌并补偿驱逐损失,实现有限KV预算下长上下文推理性能提升。
检索即推理:通过LLM-Wiki实现自我进化的智能体原生检索
LLM-Wiki将知识编译为自进化的Wiki结构,通过工具调用实现推理式检索,在多跳问答上优于现有方法。
面向教育方面情感分析的受控合成基准
生成10000条合成课程评论,含20个教学方面,BERT达微F1 0.2760,部分迁移至真实数据。
当AI在信仰问题上站队:AI介导的信仰指导中的持久不对称性
大型语言模型对宗教转换建议存在系统性不对称,反复偏向特定宗教,且模式因模型而异,具有现实影响。
豪萨语和丰贝语文本与语音资源调查:可用性、质量及NLP发展差距
调查豪萨语与丰贝语公开资源,豪萨语文本多样,丰贝语有近期语音数据,指出领域多样性等优先差距。
查询自适应语义分块用于检索增强生成:一种带上下文窗口扩展的动态策略
提出QASC动态分块方法,融合查询语义,F1达0.85,较固定分块提升18%-27%,优于现有语义与代理方法。
在复杂隐藏角色游戏中评估大型语言模型
LLMs在Secret Hitler游戏中欺骗能力不足,推理增强无效,胜率降23%,游戏时长缩40%,难以复杂多轮操纵。
低资源开源文本到SQL模型的知识蒸馏
构建含模式语义、业务逻辑等任务知识库,生成多样化数据并注入推理,显著提升低资源Text-to-SQL性能。
它们能走多远?利用大语言模型进行在线影响力的红队测试
提出评估LLM政治可操控性框架,发现开源模型左倾偏差、地区差异,越狱效果因模型而异。
可学习性指导的扩散语言模型微调
提出LIFT方法,根据扩散时间步对齐学习难度,解决标准微调忽略可学习性问题,在推理任务上性能提升达3倍。
RAS:结合上下文学习的可执行Cypher查询生成的反思增强缩放方法
RAS利用执行错误反馈通过上下文学习,使Cypher查询执行错误率降低41-50%,优于独立缩放的32-38%。
AI能猜出你知道什么吗?从通信日志中评估人类领域知识的大语言模型性能比较
7个LLM从27,188条消息推断领域知识,Gemini 2.5 Flash误差最小(21.13%),GPT误差大,准确度与消息量弱相关。
图对齐拓扑作为依据检测的归纳偏差
构建参考与LLM输出的对齐二分图,训练GNN建模拓扑结构,实现SOTA幻觉检测,超越GPT-4o。
设计驱动的多语言控制:多语言稀疏自编码器与原则性层选择
多语言SAE训练及基于对齐-可分离性交集的层选择规则,稳定了语言控制的质量和识别精度。
稀疏自编码器将大脑与语言模型的对齐映射到皮层语义拓扑
稀疏自编码器分解LLM,语义特征解释大脑语言响应并预测皮层语义拓扑,跨语言泛化。
模型崩溃即文化进化
模型崩溃实为文化进化现象,组合性先升后降,首次验证LLM规模压缩-通信权衡,效应显著。
Memorization Dynamics of Fill-in-the-Middle Pretraining
面向卡萨雷乌萨希腊语议会文本的可复现通用依存关系风格流水线
提出可复现的UD解析流水线,最佳XLM-R模型LAS达0.5162,并开放全部资源。
针对自闭症社交语言障碍特征评估的主动式多智能体对话框架
提出TPA主动多智能体框架,通过主动选择提问策略,使自闭症社交语言障碍特征覆盖率升至82.1%,诊断效率显著提升。
脑-LLM对齐取决于训练数据,而非语言类型
训练语言主导性驱动脑-LLM对齐,英语优势源于训练数据假象;类型学差异影响语法区域,分词因子解释层迁移。
HawkesLLM: 智能体文本模拟中的语义不确定性传播
HawkesLLM分离时间与文本生成建模,在智能体文本模拟中传播语义不确定性,提升后期语义对齐。
语言模型知道不该说什么吗?——大语言模型中统计优先抑制的因果证据
证实大语言模型通过分布竞争获取负面语言知识,与人类判断高度相关,支持构式语法的核心机制。
DreamerNLplus:利用混合规则与RAG方法对社交媒体时间线中的心理健康动态进行可解释建模
提出混合规则与RAG框架,在CLPsych 2026任务中排名第1(改善)和第3(恶化),揭示分类与回归不匹配等挑战。
效率前沿:大语言模型上下文管理中成本-性能优化的统一框架
提出效率前沿框架,优化LLM上下文管理成本与性能,在HotpotQA上实现25% token节省,性能持平。
结构主题模型与BERTopic在简短开放式调查回应中的比较评估
比较STM与BERTopic分析简短开放式调查回应,BERTopic主题连贯性更优,上下文增强效果最佳;STM更适用于推断性协变量分析。
长上下文大语言模型中的位置失败:推理基准测试中的一个盲点
长上下文推理基准忽视位置控制,模型在中间位置性能随长度增加大幅下降,暴露评估盲点。
当症状不足时:大语言模型精神科筛查中的证据加权模式
大语言模型筛查精神疾病时,易因功能完好或保护性背景而低估症状证据,需谨慎验证。
以X身份做Y:角色与任务如何在指令微调大模型中结合
角色与任务在残差流中局部可加,但无法压缩为单向量,因生成需依赖分布式提示/KV机制。
明末清初文集私人信件标题的微调BERT分类器
提出Lepton模型,微调BERT精准分类私人信件与易混淆序言,已用于CBDB识别数万信件。
相同模型,不同弱点:语言与模态如何重塑前沿多模态大语言模型的越狱攻击面
跨语言红队测试揭示,语言和模态的防御失败机制不同,安全排名不跨语言保持,需重构评估框架。
Fast-dDrive:面向自动驾驶的高效块扩散视觉语言模型
Fast-dDrive提出块扩散VLA,在语义单元内双向细化并保持因果顺序,结合支架推测解码实现12倍加速,轨迹预测达SOTA。
训练数据对强化学习记忆代理的影响:记忆增强问答中课程效果的实证研究
课程组成精细调节代理技能专业化,混合课程总体最优,但单指标对比掩盖了按类型的效果差异。
DFKI-MLT 在 SemEval-2026 任务7中:引导多语言模型掌握文化知识
使用激活引导增强多语言模型文化知识,MCQ准确率86.96%排名第7,效果因层与语言对而异,需联合优化提示设计。