从诗歌预测诗人籍贯:《全唐诗》中地域语言指纹的计算分析
分析《全唐诗》发现地域语言指纹可预测诗人籍贯,南北准确率0.69,语言距离随地理距离增加,晚唐区域差异最明显。
Metis:为自进化代理架起文本与代码记忆的桥梁
Metis采用层次化双表示记忆,融合文本与代码优势,任务准确率提升20.6%,执行成本降低22.8%。
MedBench v5:动态、过程导向且具幻觉感知的临床多模态模型基准
提出动态过程导向的临床多模态模型基准,包含双维框架、压力测试、过程审计和幻觉追踪,揭示性能与稳定性的不一致。
BehaviorBench:行为科学任务基础模型基准
BehaviorBench评估基础模型在行为科学任务中的个体与分布性能,专有模型个体预测强,行为模型分布对齐更优。
一种结合贝叶斯逆辨识的合成可靠性感知PINN基准,用于海上风机支撑结构监测
提出Digi Turbine基准,用物理信息神经网络与贝叶斯逆辨识实现海上风机单桩支撑结构可靠性监测。
基于方面的情感演化及其与多轮同行评审轮次的相关性:一种深度学习方法
用深度学习分析多轮同行评审,发现随轮次增加积极情感上升、消极下降,方面情感得分与轮次负相关。
波你尼语法:印度语言处理的基础
波你尼语法统一印度语言NLP,基准测试提升性能与迁移性,并引发模型是否隐含其范畴的可解释性问题。
MMed-Bench-IR:面向多语言医学信息检索的异构基准
MMed-Bench-IR通过三个异构任务评估多语言医学检索,发现跨语言性能严重下降(英文0.818 vs 日文0.056)。
大语言模型评估中提示排序的稳定性研究
揭示提示排名不稳定导致选择不可靠,提出基于置信下限的稳定性感知策略提升鲁棒性。
CALIBER: 语言模型推理前后置信度校准
CALIBER方法在推理前后分别估计置信度并匹配监督目标,显著降低校准误差。
SURGELLM:通过任务感知特征门控与类别平衡归一化重新思考多任务评估
提出SURGELLM框架,利用特征门控、任务前缀和实例加权归一化解决多任务评估,macro-F1达0.940,超越基线。
鸽笼效应:错误提示导致模型崩溃与出错
不良上下文使模型性能下降38-40%、模式崩溃(重复错误/答案收敛/立场翻转),随对话轮次恶化,合成错误RLVR可缓解43-60%。
AVOC:通过检索启发的令牌压缩增强全模态大语言模型中的小时级音视频理解
AVOC以检索式令牌压缩突破长音视频理解瓶颈,在两项长视频基准上平均准确率分别提升4.9和5.5个百分点,支持长达一小时的精准检索。
布拉格依存树库——整合版2.0:丰富一个复杂的标注方案
PDT-C 2.0是含指代和话语关系的捷克语依存树库,近400万词,用于NLP工具国际比较。
跨垂直领域的Transformer语言模型:架构、应用与批判性评估
综述Transformer架构分类及应用,批判性评估参数与能耗权衡,讨论对齐方法与基准饱和问题。
通过WordNet自动标注阿英词典词义的词性
提出算法利用WordNet自动标注阿英词典词义词性,高准确率低成本。
介绍 UD_Czech-PDTC:一个大规模且体裁丰富的通用依存树库
捷克语UD树库PDT-C经转换扩充,规模翻倍且体裁多样,本文探讨注释差异与转换方法。
MorFflex:处理丰富形态
MorfFlex是一种高效管理屈折与派生的形态词典架构,压缩超1亿词形,支撑树库标注一致性与先进NLP工具。
MEMPROBE: 通过隐藏用户状态恢复探测智能体长期记忆
MEMPROBE通过重建用户状态直接评估智能体长期记忆,发现任务完成与记忆恢复是不同能力。
超越对数概率:用于基于LLM的文档字段提取的多信号置信度引擎
ExtractConf利用双视角分歧与多信号融合,实现99.1%准确率并降低70%风险。
逃离自我确认陷阱:面向智能体经验学习的执行-蒸馏-验证范式
EDV框架通过多智能体并行探索、第三方蒸馏与共识验证,过滤错误经验,避免自我确认陷阱,提升学习可靠性。
非洲语言税:量化前沿大语言模型分词非洲语言的成本、延迟与上下文代价
非洲语言分词代价达英语数倍(最高8.9倍),导致高成本、高延迟、有效上下文仅11%,加剧数字鸿沟。
Poster: Exploring the Limits of Audio-Based Detection of Turkish Phone Call Scams
UOL@IDEM在BEA 2026共享任务1中的方法:基于神经融合与丰富特征的L1感知词汇难度预测
融合多语言表示与频率、语义等特征,预测西、德、中词汇难度,频率最稳定但简单词常高估。
NatureBench:编码代理能否媲美《自然》家族论文的已发布SOTA?
NatureBench评估编码代理在90个科学任务中仅17.8%超越SOTA,成功源于方法翻译而非科学发明。
跨语言探索参数化知识
跨语言提示探索能有效解锁大型语言模型潜在参数化知识,提升知识转移与事实回忆。
AGORA:基于档案的智能体工作场所文档推理基准
Agora基准评测智能体海量文档推理,最强模型准确率仅59.4%。
AutoSpecNER:用于车辆规格提取的细粒度命名实体识别数据集
提出含659个广告、15类实体的AutoSpecNER数据集,DeBERTa达90% F1,优于规则和LLM。
比较还是不比较:论评估社会偏见的方法论实践
比较评估会催化模型潜在歧视,链式思考加剧偏见,且偏见随模型规模增大。
CN-NewsTTS Bench:面向原始输入的中文新闻TTS发音的目标级自动基准测试
CN-NewsTTS Bench评估中文新闻TTS原始文本发音,最佳准确率0.879,多数低于0.60。
Qwen-AgentWorld:通用智能体的语言世界模型
提出Qwen-AgentWorld语言世界模型,模拟7领域环境,在AgentWorldBench超越前沿模型,支持环境模拟和下游预训练。
同一教训,不同故事:大型语言模型中文化叙事的跨语言重构
跨语言提示保留语义,但系统性改变叙事要素;多语言LLM依赖共享语义抽象,需更全面评估文化根基。
论证缺口:基于声明条件的再评分事实核查方法
提出SIFT和WSP方法,通过声明条件再评分自动核查证据与声明是否匹配,性能提升显著。
通过多智能体语义重写的隐私保护RAG:兼顾保密性与上下文保真度
提出多智能体语义重写框架,隐私泄露降至1例,上下文保真度BLEU-1达0.122,且无在线延迟。
人机协作中用户语音翻译心理模型的测量
通过跨语言问答任务研究用户对语音翻译的心理模型,发现练习和源语言知识可增强模型,语音转录有助提升。
Harmonic:用于高效长上下文语言建模的分层状态空间模型
Harmonic分层状态空间模型在长上下文语言建模中显著优于Transformer和Mamba,支持超长序列且计算复杂度线性。
AI-PAVE-Br:利用大型语言模型通过黄金集方法增强产品属性值提取
提出AI-PAVE-Br系统,用LLMs和黄金集提升葡萄牙语产品属性值提取,性能优于传统NER。
DREAM:基于自回归建模的密集检索嵌入
DREAM将检索相似度注入冻结LLM的注意力头,利用自回归预测损失训练密集检索器,性能优于基线。
我们准备好迎接智能体原生记忆系统了吗?
系统研究智能体记忆四模块,评估12系统发现无通用架构,揭示成本-性能权衡,指明原生记忆系统方向。
从任务引导的对话图到面向目标的对话运行时
提出GODR设计模式,管理复杂对话中目标的生命周期(挂起、恢复、修改、失效),超越简单图工作流。
付费知情:智能代理电商中已验证产品信息的微交易市场
代理电商中,自主代理微交易付费逐步解锁已验证信息,奖励真实质量,促进公平竞争。
SHERLOC:面向代码修复代理的结构化诊断定位
SHERLOC无训练框架实现SWE-Bench SOTA定位,提升修复率5.95pp,减少定位和总令牌36.7%和23.1%。
少即是多:面向科学摘要的质量感知训练数据选择
构建大型生物医学摘要数据集,发现作者摘要质量不一,按质量选择训练数据可提升效率,优于随机采样。
L3Cube-MahaPOS:一个马拉地语词性标注数据集和BERT模型
发布含3.2万手工标注句子的马拉地语词性数据集,MahaBERT-v2模型达88.67%准确率。
任务分解以提高标注效率
提出任务分解法降低标注推理负担,通过识别中心优化子任务分配,提升预算内质量。
EvidenceLens:用于审计金融问答的声明-证据矩阵
EvidenceLens用多模态矩阵分解金融问答为原子声明,可视化对齐证据,识别虚假或过度自信的合成回答。
CANDLE:使用轻量级编码器的字符级阿拉伯语噪声去重
CANDLE创新应用CTC进行阿拉伯语字符去重,无需规则,错误率低至5.37%,蒸馏后深度减3倍,分词器生育率降12.8%。
后验精炼:基于任意顺序流映射的快速语言生成
提出FMLM+框架,通过后验精炼实现单步生成与自适应纠正,以32倍更少NFE达到基线质量。
面向对齐器-编码器ASR的渐进式对齐目标
提出InterAligner,通过中间对齐与CTC损失渐进优化对齐,在LibriSpeech上将WER从5.0/7.8降至3.1/5.6。
少样本思维链驱动推理以促进大语言模型进行开放式医学问答
提出开放式医学问答数据集MEDQA-OPEN及CLINICR推理提示,优于现有方法,并探索多鉴别诊断与奖励模型验证。