10055 条条目 · 106 个活跃源
2026年7月22日
04:00
arXiv cs.CL

DAIS:面向复杂推理的依赖感知中间QA监督

DAIS将推理链转为阶段级QA记录,平均提升复杂推理准确率4.2%,最大提升5.6%。

04:00
arXiv cs.CL

从76,000份能源系统研究中自动提取技术经济数据

自动提取7.6万篇能源系统研究数据,构建300万数据点FAIR数据库,揭示研究假设与实证差异。

04:00
arXiv cs.CL

MedDDC-Eval:多轮医疗咨询智能体的诊断解耦评估

提出诊断解耦评估框架,分离病史与诊断,提升归因准确性并指导策略优化。

04:00
arXiv cs.CL

推理先行:通过结构化推理增强法律机器翻译

比较多种方法,强化学习在小型法律NMT中超越监督微调,接近但不及推理模型。

04:00
arXiv cs.CL

多模态大语言模型的计算幽默:方法、数据集、评估与挑战

综述多模态LLM视觉幽默理解与生成,聚焦方法、基准与评估,指出捷径评估、文化覆盖等主要障碍。

04:00
arXiv cs.CL

MIRA-Ev:临床考试中细粒度证据检测与关系推理的基准

面向临床考试的细粒度证据检测与关系推理基准MIRA-Ev,含三语版本及三级论证任务。

04:00
arXiv cs.CL

推理的代价:神经机器翻译中强化学习的成本-质量权衡

研究显示推理提升翻译质量但增加计算成本,需在成本与质量间权衡。

04:00
arXiv cs.CL

中文标题:选择塑造边界:未选择NLI群体中单调性与标签一致性的预注册复制研究

中文摘要:复制发现,先前在低一致性样本中观察到的非向上单调算子导致标签一致性降低的现象,在完整数据集中不成立,效应极小且方向相反。

04:00
arXiv cs.CL

面向LLM跨语言事实一致性的推理时引导策略

四种推理时干预缓解跨语言事实不一致,角色提示最平衡有效。

04:00
arXiv cs.CL

Prompt Design at Scale: How Format, Instruction Count, and Context Length Shape Instruction Adherence and Hallucination in Large Language Models

实验发现:指令数达80条时响应全失准;上下文超128k后召回骤降,但模型从不编造,拒答率飙升。

04:00
arXiv cs.CL

两级元评估框架下的开放生成评估:GAMUT事实完整性基准

提出两级元评估框架及GAMUT基准,用于评估开放生成的事实完整性,最佳模型得分58.7%,挑战性强。

04:00
arXiv cs.CL

MeetingToM:在多参与者会议中评估多模态大语言模型的心理理论推理能力

MeetingToM基准评估会议心理理论推理,聚焦伪共识,揭示模型难整合非语言线索和推断隐藏态度。

04:00
arXiv cs.CL

减少复制,增强接地:基于证据感知强化学习的长上下文推理纠偏

长上下文LLM存在重复复制问题,GEAR通过证据感知奖励塑造,提升推理准确率并减少复制,平均提升4.6点。

04:00
arXiv cs.CL

面向语言模型推理的选择性状态空间适配与检索

提出MaLoRA与MaRA两种状态空间适配器,在多个大模型和推理基准上平均F1提升6.8点,最高9.3点。

04:00
arXiv cs.CL

多步骤工具增强型Agent中的绑定漂移

形式化绑定漂移与错误传播,实体锁放大错误3倍,LLM重验证减少79%,自然场景漂移率18%。

04:00
arXiv cs.CL

约鲁巴语情境语音合成器:系统设计、音系规则架构及声调轮廓的正字法扩展

提出约鲁巴语规则基双音子语音合成器,通过音系规则处理声调与升降调,并扩展正字法标记,经听者实验评估。

04:00
arXiv cs.CL

Measuring AI innovation with trademark data

04:00
arXiv cs.CL

EmoEUS:对话中多模态情感识别的不确定性监督

EmoEUS通过动态加权模态的方差估计和显式监督损失实现不确定性感知融合,在IEMOCAP和MELD上超越现有方法。

04:00
arXiv cs.CL

实现多语言隐私政策审计:西班牙移动应用大规模分析

多语言隐私审计揭示西班牙公共与商业应用语种差异及声明实践不符。

04:00
arXiv cs.CL

标记而非擦除:LLM双重用途知识的令牌接种法

Token Inoculation通过预训练标记绑定与微调条件控制,保留双重用途知识并实现选择性拒绝,达到最佳安全-效用权衡。

04:00
arXiv cs.CL

AutoIndex:为检索学习表示程序

AutoIndex通过搜索文档表示程序优化索引,在8个任务上平均Recall@100提升8.4%、nDCG@10提升8.3%。

04:00
arXiv cs.CL

PLAID-PRF: 在PLAID中使用类似质心标记的伪相关反馈

提出PLAID-PRF,利用质心向量进行伪相关反馈,扩展查询,提升检索效果且计算开销小。

04:00
arXiv cs.CL

陈旧却稳定:用于稳定异步强化学习的延迟自适应信任区域

提出延迟自适应信任区域(SAT),以陈旧性为代理调控更新,稳定异步强化学习。

04:00
arXiv cs.CL

流匹配文本转语音教师的分阶段深度剪枝蒸馏:一个紧凑的印地语语音合成器

通过分阶段深度剪枝蒸馏大模型,在17.6小时数据下得到紧凑印地语TTS,190M参数WER为0,可实时运行于6GB GPU。

04:00
arXiv cs.CL

脑电图到文本在现实场景中可行吗?基于神经心理学启发的基准深入分析

现有EEG2Text基准忽视EEG不稳定性而依赖强制评估,新范式发现无强制解码可行,构建COFETT基准实现鲁棒评估。

04:00
arXiv cs.CL

RAGAL:面向政府机构技术支持的节俭型全本地检索增强助手

在零数据出口等严格约束下,为罗马尼亚机构构建RAGAL助手,通过检索工程与微调使评估达81%、召回率0.850,并解决单域退化问题。

04:00
arXiv cs.CL

ChineseBERT:通过字形和拼音信息增强的中文预训练

提出ChineseBERT,融合字形与拼音信息,预训练后在多项中文NLP任务上达SOTA。

04:00
arXiv cs.CL

H^2SD: 混合后见之明自蒸馏

针对奖励稀疏,H^2SD根据轨迹正确性调节教师信号,成功时调制幅度,失败时反向KL,稳定提升推理性能。

04:00
arXiv cs.CL

HindsightBench:时间索引LLM决策任务中参数化后见之明的黑盒行为审计协议

提出低成本黑盒协议审计LLM后见之明,发现其依赖训练世代,有效截止日期早于报告,且受服务配置影响。

04:00
arXiv cs.CL

AdaFlash:基于在线策略蒸馏的扩散草稿模型的自适应推测解码

AdaFlash通过在线策略蒸馏和自适应长度头解决扩散草稿模型方差问题,提升推理吞吐量达66%。

04:00
arXiv cs.CL

CircuitKIT:面向机制可解释性的电路发现、评估与应用工具包

CircuitKIT以类型化可序列化表示连接电路分析工作流,提供发现、评估与应用一体化工具。

04:00
arXiv cs.CL

基于多轮问答的实体关系抽取

提出将实体关系抽取转化为多轮问答,利用MRC模型在多个数据集上取得最优结果,并构建中文简历数据集验证。

04:00
arXiv cs.CL

面向数据不平衡NLP任务的Dice损失

用Dice损失替代交叉熵并动态加权易负例,缓解数据不平衡,显著提升F1,实现多项NLP任务SOTA。

04:00
arXiv cs.CL

野外智能体:研究走向部署

聚焦LLM智能体从研究到部署的鲁棒性安全挑战,通过制药金融案例提供设计模式与缓解策略。

04:00
arXiv cs.CL

MEDIC:临床应用中大语言模型安全性与实用性的领先指标综合评估

MEDIC框架揭示临床LLM知识-执行鸿沟及安全维度差异。

04:00
arXiv cs.CL

突破MoE大语言模型三难困境:动态专家聚类与结构化压缩

通过动态专家聚类和结构化压缩,解决负载不均、参数冗余和通信开销问题,参数减少80%,吞吐提升10-20%。

04:00
arXiv cs.CL

ScienceMeter:追踪语言模型中的科学知识更新

提出ScienceMeter框架评估LLM科学知识更新,最佳方法保留85.9%、获取71.7%、投影37.7%,凸显挑战。

04:00
arXiv cs.CL

拯救英雄伊巴什的遗产:评估四种用于阿米诺亚语的语言模型

评估四种语言模型在低资源阿米诺亚语中的表现,剖析适应性及局限,为弥合语言鸿沟奠定基础。

04:00
arXiv cs.CL

XCOMPS:多语言概念最小对基准

XCOMPS基准评估LLMs多语言概念理解:低资源语言弱,形态复杂语言得分低;指令调优提升表现但不增强内部能力,知识蒸馏增益有限。

04:00
arXiv cs.CL

TReB:评估大型语言模型表格推理能力的综合基准

提出TReB基准,含26子任务、高质量数据集和三种推理模式,揭示大模型表格推理仍有提升空间。

04:00
arXiv cs.CL

节点即智能体:图智能体网络

ReaGAN框架:节点作为智能体自主规划,结合检索增强建立全局关系,无需微调实现少样本上下文学习。

04:00
arXiv cs.CL

评估风格个性化文本生成:挑战与方向

批判性评估BLEU等指标,提出风格判别基准,发现多指标集成更可靠,提供评估指导。

04:00
arXiv cs.CL

超维度探针:通过向量符号架构解码大模型表示

提出超维度探针,结合向量符号架构与神经探针,统一输入输出分析,精准提取语义信息,克服现有方法局限。

04:00
arXiv cs.CL

防护向量:结合任务向量组合与流感知前缀SFT超越英文大语言模型护栏

Guard Vector通过任务向量组合实现多语言安全,流感知前缀SFT与单token输出提升效率降低资源。

04:00
arXiv cs.CL

PRISP:通过轻量适配实现隐私安全的少样本个性化

PRISP框架利用Text-to-LoRA超网络,从任务描述生成LoRA参数,用少量用户数据优化,实现隐私安全、低计算开销的少样本个性化。

04:00
arXiv cs.CL

认知熟悉度与大型语言模型中的信念稳定性相关

认知熟悉度高的语句在语义扰动下信念更稳定,不熟悉语句易致信念撤回,撤回率超50%。

04:00
arXiv cs.CL

大语言模型通过潜在蒸馏探索

ESamp解码法利用蒸馏预测误差作为新颖性信号,促进语义多样性,提升推理模型Pass@k效率,打破多样性-连贯性权衡。

04:00
arXiv cs.CL

PyPhonPlan:使用动态神经场和任务动力学模拟语音规划

PyPhonPlan开源工具包,通过动态神经场耦合任务动力学模块,模拟语音规划中的生产/感知循环,支持交互式语音动态建模。

04:00
arXiv cs.CL

LinguistAgent技术报告:面向自动化语言标注的反思性多模型平台

LinguistAgent平台利用反思性多模型架构自动化语言标注,有效复现隐喻识别任务。

04:00
arXiv cs.CL

泪与笑?基于文化诱发情感差异的LLM基准测试

提出多模态基准CEDAR,发现LLM语言一致性与文化对齐脱节,文化情感理解仍是挑战。