评估风格个性化文本生成:挑战与方向
批判性评估BLEU等指标,提出风格判别基准,发现多指标集成更可靠,提供评估指导。
超维度探针:通过向量符号架构解码大模型表示
提出超维度探针,结合向量符号架构与神经探针,统一输入输出分析,精准提取语义信息,克服现有方法局限。
防护向量:结合任务向量组合与流感知前缀SFT超越英文大语言模型护栏
Guard Vector通过任务向量组合实现多语言安全,流感知前缀SFT与单token输出提升效率降低资源。
PRISP:通过轻量适配实现隐私安全的少样本个性化
PRISP框架利用Text-to-LoRA超网络,从任务描述生成LoRA参数,用少量用户数据优化,实现隐私安全、低计算开销的少样本个性化。
认知熟悉度与大型语言模型中的信念稳定性相关
认知熟悉度高的语句在语义扰动下信念更稳定,不熟悉语句易致信念撤回,撤回率超50%。
大语言模型通过潜在蒸馏探索
ESamp解码法利用蒸馏预测误差作为新颖性信号,促进语义多样性,提升推理模型Pass@k效率,打破多样性-连贯性权衡。
PyPhonPlan:使用动态神经场和任务动力学模拟语音规划
PyPhonPlan开源工具包,通过动态神经场耦合任务动力学模块,模拟语音规划中的生产/感知循环,支持交互式语音动态建模。
LinguistAgent技术报告:面向自动化语言标注的反思性多模型平台
LinguistAgent平台利用反思性多模型架构自动化语言标注,有效复现隐喻识别任务。
泪与笑?基于文化诱发情感差异的LLM基准测试
提出多模态基准CEDAR,发现LLM语言一致性与文化对齐脱节,文化情感理解仍是挑战。
反向思维链生成中的事后合理化度量与缓解
量化反向思维链中的事后合理化偏差,提出结构骨架推理法替代语义抑制,减少答案依赖并提升性能。
PlotTwist:一种使用小型语言模型的创意情节生成框架
提出PlotTwist框架,用≤3B参数小模型通过偏好对齐生成高质量情节,效果超越前沿大模型。
使用解码约束束搜索估计语言模型中的近似逐字提取风险
提出解码约束束搜索,高效估计近似逐字提取风险,揭示常规方法遗漏的大量可提取序列和模式。
Doctorina MedBench-ICD10:基于对话的智能体医疗AI基准与评估框架
提出对话式医疗AI评估框架,通过D.O.T.S.指标模拟医患交互,更真实评估临床能力。
向量化前缀树:加速器上基于LLM的生成式检索的高效约束解码
通过将前缀树转化为稀疏矩阵,实现向量化约束解码,在加速器上获得千倍加速,首次实现生产级严格约束生成式检索。
可解释性能否预测模型在未见数据上的行为?
利用内部注意力模式预测分布外行为,观测分析可预测规则即使因果失效,为可解释性新目标提供概念验证。
PARSE:专业领域LLM智能体的溯源感知检索净化
PARSE在122项真实专业文档任务中,攻击成功率降至15.6%(降38%),效用86.9%,是唯一显著且保持近基线效用的防御方法。
CLT-Forge:用于跨层转码器和归因图的可扩展库
提出CLT-Forge开源库,集成分布式训练与自动化可解释性,实现跨层转码器的端到端训练与归因图分析。
鲁棒推理基准
提出鲁棒推理基准,发现开源模型在文本扰动下准确率骤降54%,归因于自注意力稀释,需整合上下文重置。
FinRAG-12B:银行业中基于证据的问答的生产验证方案
银行问答模型FinRAG-12B,高效训练提升准确率与引用,校准拒绝,部署40+银行,查询解决率升7.1%,成本降20-50倍。
长度价值模型:面向Token级长度建模的可扩展价值预训练
LenVM通过token级价值估计提供无监督密集信号,实现精确长度控制与预测,显著提升性能。
越编越稳:理解序列模型编辑中的终身归一化
揭示终身归一化通过自增强循环和渐近正交更新缓解遗忘,据此提出StableEdit,提升长期稳定性。
多级上下文建模实现混合专家模型中一致的专家选择
通过跨层语义聚合与局部交互构建上下文感知表示,显著提升专家路由一致性与模型性能。
NOWJ@COLIEE 2026:面向法律检索与推理的自适应流水线
提出多阶段自适应流水线,覆盖检索、重排序、蕴含验证与动态路由,用于法律领域五项任务。
语言模型虽努力仍会犯错:面向自我纠正科学生成的共形预测
提出图结构共形预测框架SFC,通过实时验证保证科学推理有效性,准确率达50.1%,减少73%科学违反。
RIMS:面向小型LLM检索增强生成的平滑多对聚合偏好优化
RIMS通过平滑多对聚合优化偏好,提升小模型检索增强生成抗噪性,实验优于基线。
在推理之前就承诺:开放权重大语言模型中答案预承诺的行为复制与初步激活层证据
LLM在推理前预承诺错误答案,隐藏状态在输出前已显示倾向,推理无法纠正,行为复制与激活证据支持。
编码脑电图信号以检验语言模型中类人下一词预测行为
仅惊奇度与阅读认知电位相关,扩大模型参数不必然提升类人语言处理一致性。
开放语言模型:面向教育与研究的可读可组合小语言模型预训练
开源PyTorch库,实现可读可组合的小语言模型预训练,面向教育与研究,代码即架构。
从记忆到技能:基于证据的共演化治理用于长周期大语言模型智能体
提出MSCE框架,无需训练即可将记忆转化为技能,实现长周期智能体持续进化。
SpecLA:面向线性注意力模型的高效推测解码
SpecLA通过拓扑感知核验证与紧凑状态恢复,实现线性注意力模型1.7倍推测解码加速。
算术启发式神经元是否形式不变?LLM中符号、文本与代码的机制分析
LLM算术启发式神经元跨格式共享且形式不变,失败源于激活状态而非不同电路。
基于轨迹的在线策略蒸馏用于掩码扩散语言模型
TOPD通过教师监督目标扩散模型自身的去噪轨迹,无需奖励估计,在数学推理上匹配RL效果并实现96倍计算加速。
JOR-Bench:面向大语言模型的日文运筹学基准
提出日文运筹学基准JOR-Bench,评估7个LLM,发现强多语言模型能力语言无关,但存在跨语言差异。
群体熵控策略优化
基于群体熵的不对称优势塑造,平衡多任务探索-利用,显著提升对齐性能。
模式约束的文档级事件论元抽取与轻量级LLM微调
利用LoRA微调中等开源LLM,结合角色注入与JSON后处理,在MAVEN-ARG上超越GPT,Phi-4达42.39% F1。
层级式攻击性语言检测中的级联建模与联合建模对比
级联系统准确性更高,尤其在类不平衡子任务上宏F1提升7.1点,但代价是参数增加3倍、延迟增加1.67倍。
自判断混淆下的正确性探针诊断
客观正确性探针受自我判断混淆,跨域转移性仅保留自我判断极性,不保证客观正确语义。
在迭代指令微调中从合成数据学习而不发生模型崩溃
发现合成数据训练导致能力极化,提出KITE框架通过失败引导和边界感知策展实现稳定改进。
AI代理起草转化影响摘要的真实世界评估
人机协同AI代理可替代15小时人工汇编,审查时间降至14分钟,81.7%结果可用,准确率4.5,有用性4.8。
BLAD:一部历史语境化的孟加拉国法律法案多语言数据集(1799-2025)
提出BLAD数据集,含1484条孟加拉国法案(1799-2025),多语言结构完整,填补南亚低资源法律NLP空白。
Scope3Trace: Evidence-Based Identification and Extraction of Scope 3 GHG Emissions from Sustainability Reports
使用QQ等式审计大语言模型中的问题顺序效应:机制刻画与饱和警示
将QQ等式发展为LLM顺序效应审计准则,理论刻画机制类,实证发现多数项对饱和,建议预指定饱和诊断。
PAN 2026上的DACTYL团队:用于AI文本检测的贝叶斯数据混合与经验X风险最小化
利用贝叶斯数据混合及经验X风险最小化,MCGrad模型以0.974分获PAN 2026第二,证明数据集筛选提升分布外性能。
吉尔吉斯LLM基准:吉尔吉斯语言理解评测
首个系统评估吉尔吉斯语LLM的基准套件,含原生和翻译数据集,揭示跨语言迁移及翻译伪影。
Robust Summarization of Doctor-Patient Conversations: TalTech Systems for the Beyond Transcription Challenge
LLM生成文本中的文学非风格
LLM文本n-gram统计显示风格缺陷,且风格与语义不可分离。
AI讲座笔记:韩英医学讲座中后ASR工作流的英文脚本呈现与语义漂移回顾性试点研究
后ASR工作流提升英文术语呈现率,但引发语义漂移与极性错误,需独立评估表面准确性与语义保真度。
EvolvingWorld:交互式文学世界中角色扮演智能体与世界模型协同演化的开放模式框架
提出EvolvingWorld框架,实现角色与世界的长期协同演化,通过开放模式动态更新状态,提升交互文学模拟连贯性。
多模态情感分析中缺失模态是否必须修复?
挑战缺失模态先修复范式,提出SIEVE自适应决策是否修复,实验验证有效性。
图论辩:大语言模型在不确定知识图谱上的可靠自适应推理
提出Debate-on-Graph框架,通过启发式搜索与多方辩论利用不确定知识图谱,实现可靠自适应问答推理,性能最优。