9946 条条目 · 106 个活跃源
2026年8月13日
04:00
arXiv cs.CL

超越单轮置信度:面向LLM智能体的轨迹自适应不确定性量化

单轮不确定性量化用于多轮智能体轨迹效果不均;自一致性最佳,轨迹等价变体最优,令牌概率对聚合器敏感。

04:00
arXiv cs.CL

Reddit上网络性暴力叙事中的污名与支持

研究Reddit性暴力叙事,构建SCOPE数据集,发现内化污名最常见,社区回应以信息和尊重支持为主。

04:00
arXiv cs.CL

强化步骤级推理以实现LLM的有效自我纠正

提出SFS-DPO两阶段框架:先步骤级偏好优化强化推理,再训练自我验证与纠正,优于基线。

04:00
arXiv cs.CL

主特质分析:迈向在人机协作中提炼“技能”

主特质分析从人机对话中提取协作特质,能解释行为并预测结果,但作为技能仍待验证。

04:00
arXiv cs.CL

AWARe:通过激活加权自适应保留缓解灾难性遗忘

提出AWARe微调法,按激活模式动态冻结关键参数,防止多模态大模型遗忘旧知识,兼顾下游性能。

04:00
arXiv cs.CL

措辞效应:量化大语言模型基准性能中的双向漂移

重述问题会双向改变模型答案;越强的模型损失越多,脆弱性源于措辞本身。

04:00
arXiv cs.CL

当API说错语言:重新审视多语言工具使用的后训练

多语言API调用中,模型常生成语言不一致的参数值(ALM)。微调可大幅提升一致性,效果不逊于强化学习;后者仅在泛化与多目标权衡上有边际增益。

04:00
arXiv cs.CL

定位与控制大型语言模型中的隐式个性化

研究表明LLM输出随隐性人口线索变化,对应内部激活信号可定位并干预,抑制其影响优于提示词。

04:00
arXiv cs.CL

语义莱尼亚:大型语言模型语义空间中稳态孤子的涌现

将大模型推理变为连续动态系统,通过稳态反馈涌现语义孤子,维持混沌边缘,实现溯因跳跃并建立认知标度律。

04:00
arXiv cs.CL

你会投给谁?审计大语言模型的政治倾向:意大利案例研究

提出可复现的审计框架,分析多个LLM对意大利政党及领导人的评价,发现其行为受提示词和角色设定影响,且存在不一致性。

04:00
arXiv cs.CL

涟漪枢轴搜索:扩散大语言模型的主动并行解码

提出无训练解码法RPS,利用涟漪效应加速并行解码,速度提升4-10倍,结合KV缓存达18倍,精度最高提升5.49%。

04:00
arXiv cs.CL

面向可组合非结构化知识编辑的混合策略自编辑

HPSE以混合策略自编辑,在自身轨迹补全缺失事实,无需外部监督,提升非结构化知识编辑的可组合性与多跳推理。

04:00
arXiv cs.CL

Easper:易用的语言记录ASR流水线

Easper是开源免代码ASR微调工作流。经三种瓦努阿图语测试,优先转录词汇丰富叙述并增加语音重复,可更快提升转录质量。

04:00
arXiv cs.CL

LabelFusion-TS:融合大型语言模型、Transformer编码器与金融时间序列的货币政策立场分类

融合金融时间序列与文本,美联储鹰鸽分类F1=70.2%,仅240个人工标注胜零样本LLM,证明有效。

04:00
arXiv cs.CL

TELLME:语言模型增强的测试增强学习

提出TELLME方法,结合测试增强学习与持续预训练,高效获取领域知识并增强长期记忆,金融领域提升23.6%,记忆提升9.8%。

04:00
arXiv cs.CL

已定位但不可释放:静默门反转与有界线性释放

定位成功,但门控在分布外反转失效,线性释放有界不足,二者可分离。

04:00
arXiv cs.CL

混合门控注意力

提出混合门控注意力框架,含三种门控策略,融合多阶段信息,增强表示、提升效率与稳定性,性能优于门控注意力。

04:00
arXiv cs.CL

诊断先于恢复:将智能体故障转化为选择性自我纠正

用开发集故障预筛修复干预,按故障类型选择纠正策略,减少环境步骤,提升任务性能。

04:00
arXiv cs.CL

知识库成为黄金标准:实体级机器翻译中资源共享评估循环的测量

用知识库当金标准致评估自我参照,独立段仅31.1%增益归零,弱模型虚高。

04:00
arXiv cs.CL

完全回忆,代价几何?——Agentic记忆系统服务成本基准测试

比较三种记忆系统,发现其服务成本难由对话长度预测,盈亏平衡敏感,且成本与准确性难以兼得。

04:00
arXiv cs.CL

因果结构可诱导但功能解耦:类型化机制库的路由/读出边界

因果结构可诱导但功能解耦:类型监督诱导槽组织,仅影响路由,不影响读出,零成本且可逆。

04:00
arXiv cs.CL

LazyTrain:面向大语言模型训练零浪费收益优化的有限资源分配

LazyTrain通过混合8位优化器和混合整数调度,提升有限资源下大模型训练吞吐1.24倍。

04:00
arXiv cs.CL

基于GRPO的财务建议生成:在CATE评估下超越商业LLM

用GRPO优化开源模型生成财务建议,因果审计显示其毛利提升约为商业基线两倍,下行风险最低。

04:00
arXiv cs.CL

语言条件反量化:恢复量化从非英语语言中夺走的信息

语言条件反量化(LCD)用每语言LoRA修正,恢复非英语70-83%困惑度差和17-28%准确率差。

04:00
arXiv cs.CL

中文标题:SAG:基于SQL检索增强生成与查询时动态超边

中文摘要:提出SAG架构,用事件-实体索引替代知识图谱,查询时以共享实体动态连边。在三个多跳问答数据集上均达最优,MuSiQue上Recall@5达80.36%。

04:00
arXiv cs.CL

LODESTAR:可信熵是被引导的,而非仅被测量的——强化极化器使冻结的大语言模型不被错误证据自信误导

检索增强问答中,最低熵选答案会因误导性段落而自信犯错。LODESTAR用强化学习训练固定提示串,引导冻结模型少读误导段落,F1从0.5148升至0.5339,优于十四种现有配置。

04:00
arXiv cs.CL

SLMs可信度基准测试:预训练模型vs压缩模型

量化优于剪枝,压缩可靠大模型比从头训练更可信,蒸馏可进一步增强。

04:00
arXiv cs.CL

无标签策略下准确率与顺序敏感性表现分化

无标签策略无法稳定提升多选题准确率;仅展示全部选项加大模型匹配才持平基线,消除位置偏差无增益。

04:00
arXiv cs.CL

面向孟加拉语区域方言的多方言神经机器翻译系统

构建12种孟加拉方言平行语料,微调BanglaT5达最优(BLEU 29.26),超越NLLB和mBART,并部署量化应用。

04:00
arXiv cs.CL

选择性问答的渐近风险校准

提出A-CRC-QA校准框架,对不确定性感知的选择性问答实现渐近风险控制,无需训练且模型无关。

04:00
arXiv cs.CL

偏好树优化:利用前瞻模拟增强目标导向对话

提出偏好树优化框架,结合前瞻模拟生成偏好数据,提升动机性访谈对话智能体的表现与长期规划能力。

04:00
arXiv cs.CL

Spark-to-Paper:作为可组合技能的端到端研究论文生成

提出端到端论文生成系统S2P,以13个可组合技能在编码助手中运行,引用有效性99.5%,图表可编辑96.4%。

04:00
arXiv cs.CL

QV-PIC:面向查询的视觉位置无关缓存,实现高效RAG服务

提出查询感知双分辨率视觉缓存,免在线重算,提升F1 21.6点,TTFT降83.8%

04:00
arXiv cs.CL

视角空间的结构化

综述自然语言处理中的视角概念以属性区分立场情感框架等提出单轴层级结构帮助研究者选择适当的操作化定义

04:00
arXiv cs.CL

信息丰裕悖论:长上下文训练削弱参数化知识

长上下文训练虽提升短期表现,但削弱参数化知识,性能先升后降。

04:00
arXiv cs.CL

特定语料临床RAG系统在HealthBench上媲美或超越新一代前沿大模型

临床RAG系统VITA在HealthBench上优于前沿LLM;换新模型和中立裁判后与GPT-5.5持平,显示语料特异性提升准确性。

04:00
arXiv cs.CL

混合线性注意力大语言模型中的大规模激活:注意力前尖峰与尖峰间平台

研究混合线性注意力大模型的大规模激活,发现注意力前尖峰与尖峰间平台,随全注意力变密相连,揭示其生命周期机制。

04:00
arXiv cs.CL

一个冻结模拟器不够:多智能体强化学习中的模拟器坍缩

单一模拟器导致模式坍缩与策略过拟合;言语化采样和协同训练提升泛化,成功率增14%。

04:00
arXiv cs.CL

A Cascaded Unsupervised-Supervised NLP Pipeline for Detecting Accusatory Language in Public Procurement

04:00
arXiv cs.CL

RevCRN:基于化学反应网络的可逆模拟计算

研究可逆化学反应网络(RevCRN)计算实数的能力,证明有理数类严格包含于RevCRN可计算数,代数数与特定类相等,并探讨内部层级关系。

04:00
arXiv cs.CL

Confucius4-TTS:免转录跨语言零样本语音合成与可学习说话人编码器

提出免转录跨语言零样本TTS,支持14语言,两阶段架构实现高相似度与可懂度,平均词错误率3.73%。

04:00
arXiv cs.CL

影响力策略重要吗?探究LLM代码生成中的提示框架效应

基于心理学影响策略设计提示模板,测试五个开源大模型,发现强调紧迫性会降低代码正确性与安全性。

04:00
arXiv cs.CL

结构性沉默:当AI基础设施使少数语言使用者失语

以孟加拉语为例揭示AI基础设施四重结构性失败即网络数据缺口令牌赤字分词惩罚连接排斥主张离线优先

04:00
arXiv cs.CL

基于结构化说话人条件的Whisper鲁棒多层级婴儿中心音频理解

基于Whisper的多层级婴儿音频识别器利用说话人感知与因子化令牌提升跨家庭鲁棒性实现全天候录音标注

04:00
arXiv cs.CL

RT-SEMamba:渐进知识蒸馏驱动的实时语音增强Mamba

基于Mamba的实时增强,渐进蒸馏压缩模型,PESQ 3.18,提速2.75倍

04:00
arXiv cs.CL

量化治疗性大语言模型中临床安全性与环境影响的关联

临床安全分数提升二点六一个百分点,能耗约增六十倍;增加算力未必改善安全,宜动态选模。

04:00
arXiv cs.CL

中国原产视觉语言模型如何在国家对齐中从拒绝转向重构

中国原产视觉语言模型在中文提示下更易将拒绝转为国家对齐重构,审查从显性拒绝变为隐性重构。

04:00
arXiv cs.CL

ToolHazard:面向LLM智能体安全评估与对齐的可扩展对抗环境

提出ToolHazard可扩展对抗环境合成框架,自动生成攻击与基准,揭示LLM代理漏洞,提升安全对齐。

04:00
arXiv cs.CL

Mechanist:以AI为科学仪器,探索智能机制

自动发现AI智能机制的智能体系统,优于现有方法,并应用于风险揭示与模型改进。

04:00
arXiv cs.CL

MuseCritic:通过自然语言美学评论学习多维度歌曲奖励

MuseCritic用自然语言评论预测多维度歌曲奖励,降低评分误差,提升生成模型对齐效果。