LoSoNA:群体对话中局部社会规范适应的基准
LoSoNA基准测试LLM从群聊中推断并适应局部规范,显式提示效果不均,最佳模型达84%。
表征AI生成故事中的文化本地化
提出方法测量模板本地化程度,发现仅9-17%词汇区分国籍,共享叙事模板存在,全球南方国家文化标记多具冒犯性。
面向长上下文建模的知识图谱增强记忆检索
提出KGERMAR框架,通过动态知识图谱融合语义与关系,实现高效长上下文建模,困惑度降低8.5%,记忆效率提升2-2.5倍。
AdaSR:基于分层相对策略优化的自适应流式推理
AdaSR框架实现流式推理自适应,HRPO分层优化平衡准确性、效率与延迟。
CORAL:通过一致性导向推理对齐分析与弥合多模态RLVR中的思维-答案鸿沟
针对多模态强化学习中思维与答案不一致问题,提出CORA方法,通过轻量级一致性奖励模型及混合奖励优势拆分,有效提升任务性能与推理忠实度。
间接计算模型与间接形式方法
基于间接计算模型与形式方法,协同智能计算系统优化云计算为知识中心。
智能体浏览器的同源策略
研究同源策略在智能体浏览器中的有效性,发现违规频繁,提出SOPGuard有效强制且开销小。
ADORE:基于检索的关联反馈的迭代查询扩展
ADORE迭代框架利用检索反馈进行查询扩展,显著提升检索性能,在BEIR上nDCG@10较BM25提升24.5%。
通过结构化剪枝和低位量化实现神经说话人日志中的效率-性能权衡
通过剪枝和量化压缩说话人日志模型,低延迟损害性能,FP16减半模型大小但错误率增加40%。
课堂环境中的多模态说话人识别
融合声学与语义的多模态框架,将课堂说话人识别准确率从39%提升至50.3%,长句达76.9%,角色识别达99.3%。
教育科技的激励因素:EduNLP研究的系统综述
系统综述发现EduNLP研究教师受益不足(33.3%),部署率低(9.8%),伦理流于表面,建议加强负责任实践。
面向动态声源的时空音频语言建模
提出ST-AudioQA数据集和ST-AudioLM模型,实现动态声源的语义与轨迹联合推理,提升时空音频问答性能。
检测意大利媒体中的历史转折点:历时新闻语料库的复杂系统方法
用NLP与复杂系统方法分析意大利报纸语料,无监督检测出政治转折与国际冲突等关键历史时期。
ScoreGate:通过双分数统计融合实现检索增强生成的自适应分块选择
ScoreGate利用双分数自适应控制检索数量,提升效率并减少冗余,性能优于固定K值方法。
CoRe:持续奖励微调的LLM查询重写器,用于网络规模视频搜索中的多阶段上下文感知相关性
CoRe系统通过半在线偏好优化和自动化门控,每周重新部署,在视频搜索中持续微调LLM查询重写,提升相关性并防御奖励黑客攻击。
成为我的导师:通过同伴反馈实现LLM相互改进的在线策略共蒸馏
提出在线策略共蒸馏(OPCoD),让两个不同领域更强的模型通过同伴反馈相互辅导,实现帕累托改进,在科学问答任务中优于基线。
凝视头部:视觉语言模型如何注视所描述内容
发现模型中的“凝视头”跟踪描述区域,干预可引导描述方向,无需重训练。
使用大语言模型模拟学生的Java编程错误
本文研究发现,用大语言模型模拟学生编程错误可行,Claude Sonnet 4平衡性最佳,生成错误难辨真伪,高难度问题多样性高但学生相似性低。
洪水与收获:从极限语言生成视角看琐碎知识对生成有价值数学的可证必要性
生成有价值数学需要无限但渐近可忽略的认证琐碎知识流。
Persona-Pruner:为角色扮演雕琢轻量级模型
提出Persona-Pruner框架,提取角色子网络,剪枝后性能下降减少93.8%,兼顾通用能力。
ClinHallu:医疗MLLM推理中分阶段幻覚诊断基准
ClinHallu基准含7031实例,通过结构化推理轨迹诊断医疗MLLM分阶段幻覚,并减少推理错误。
UniversalRAG:面向多样模态和粒度语料的检索增强生成
提出UniversalRAG框架,通过模态感知路由和粒度分层实现多模态异质语料库的检索增强生成,在10个基准上表现优异。
OLaPh: 最优语言音素化器
提出混合音素化框架OLaPh,结合词典与NLP技术,在标准基准上大幅领先,并利用合成数据训练LLM,展现强泛化能力。
MET-Bench:用于评估视觉-语言和推理模型局限性的多模态实体追踪基准
MET-Bench揭示视觉-语言模型文本与图像实体追踪差距源于视觉推理缺陷,强化学习提升有限,需改进多模态推理。
Reward-SQL: 逐步执行感知推理与过程监督奖励提升Text-to-SQL
提出Reward-SQL,通过逐步执行感知推理与过程奖励模型,显著提升复杂查询准确性与跨域泛化能力。
MASLab:基于大语言模型的多智能体系统的统一综合代码库
MASLab集成20+方法,统一环境与基准,降低研究门槛,覆盖10+基准和8模型实验。
哨兵:通过注意力探测解码上下文利用以实现高效大语言模型上下文压缩
哨兵框架通过注意力探测解码上下文利用,实现高效LLM压缩,性能媲美7B模型。
FineDialFact:细粒度对话事实验证基准
提出细粒度对话事实验证基准FineDialFact,从回复中验证原子事实,最佳F1仅0.74,仍具挑战性。
EiCAP:超越流畅性——基于心理学原理的多轮对话探测与提升大语言模型情感智能
提出六层情感智能框架EiCAP,发现通用微调无效,基于情感智能的直接LoRA训练可使模型情感得分从25%提升至75%。
大型语言模型中的可信不确定性:一个用于置信度校准和风险控制拒绝的统一框架
UniCR框架融合多种不确定性证据,校准正确概率并通过原则性拒绝控制风险,无需微调即可提升模型可信度。
基于弱监督自然语言处理的出院小结诊断自动识别
提出弱监督NLP方法自动识别出院小结诊断,无需人工标注,性能接近全监督,节省1500小时以上标注时间。
雅可比作用域:LLM中词元级因果归因
提出雅可比作用域,基于梯度的词元级因果归因方法,揭示LLM偏差、翻译策略与上下文学习机制。
大语言模型智能体并非总是忠实的自我进化者
研究发现,自我进化LLM智能体依赖原始经验,却常忽视浓缩经验,原因在于语义限制、处理偏差及先验知识充足。
Did You Forget What I Asked? Prospective Memory Failures in Large Language Models
全双工口语对话语言模型中的时序思考
提出时序思考机制,在听语音时增量推理,无额外延迟,显著提升全双工对话响应质量。
ClaimFlow:追踪NLP中科学主张的演化
基于1,617篇论文构建ClaimFlow,定义主张关系分类任务,揭示多数主张被重塑而非直接支持或反驳。
残差上下文扩散语言模型
提出RCD模块,回收丢弃token的上下文残差,以最小计算开销使dLLM准确率提升4-11%,AIME任务准确率翻倍、去噪步骤减少4-5倍。
道德推理习得的语用推理:通过元语用链接实现泛化
基于元语用链接与道德基础理论,开发语用推理方法,使大语言模型习得道德推理目标与社会变量链接,显著提升泛化能力。
C2-Faith:基准测试LLM判断器在思维链推理中的因果与覆盖忠实性
提出C2-Faith基准分解忠实性为因果与覆盖维度,发现LLM判断器难以准确定位错误且高估推理完整性。
专业译员能否识别AI生成的文本?
专业译员仅部分能识别AI文本,低突发性和叙事矛盾是可靠指标,但存在近半误判。
脆弱的知识,稳健的指令遵循:Llama-3.2中的宽度剪枝二分法
Llama-3.2宽度剪枝发现:减少扩展比削弱知识但增强指令遵循,多步推理稳健,挑战均匀退化假设。
自动化Agent评估的实证研究
EvalAgent通过编码评估技能自动化Agent评估,首次运行成功率从17.5%升至65%,专家偏好达79.5%。
大语言模型强化学习信任区域再思考
PPO比率裁剪对大词汇表效果差,提出基于散度约束的DPPO,提升训练稳定性与效率。
基于独立成分的故事理解过程中大脑活动编码模型
基于独立成分的编码模型可分离刺激与噪声信号,实现功能网络层面分析,提升可解释性及跨个体可比性。
断裂的思维链推理
提出Fractured Sampling,通过截断多轨迹多解插值,在推理中实现更优的准确率-成本权衡,带来对数线性增益。
ChatGPT推荐公平吗?评估大语言模型推荐中的公平性
提出FaiRLLM基准评估推荐公平性,发现ChatGPT对部分敏感属性存在不公平。
TVIR:构建面向图文交错报告生成的深度研究智能体
TVIR提出图文交错报告生成基准与多智能体框架,含文本和视觉双路径评估,实验证明其有效性。
逐字块优于提取的制品:长LLM对话中记忆表示的受控消融研究
逐字块优于提取制品15.9-22.0分,提取丢失细节,结构记忆应补充而非替代逐字文本。
大规模成功:企业检索基准构建与面向多租户搜索的索引保留查询适配
自动构建技术客服检索基准DevRev-Search,仅微调查询编码器保持索引不变,实现高效可扩展多租户检索。
基于FusionRoute的令牌级大语言模型协作
FusionRoute通过令牌级选择专家并修正logit,实现高效多模型协作,优于现有方法。