10213 条条目 · 106 个活跃源
2026年6月16日
04:00
arXiv cs.CL

在线技能和记忆模块是否值得其令牌消耗?一项关于网络代理的预算约束研究

预算约束下,增加基础角色步骤的基线方法在成功率和令牌效率上均不弱于增强模块,其收益常被高估。

04:00
arXiv cs.CL

ReportQA:基于问答的放射学报告评估

提出ReportQA框架,用大语言模型提取报告信息生成QA对,以QAScore评估,优于现有指标,并发布知识树和代码。

04:00
arXiv cs.CL

AdaMame:自适应多语言推理的训练方案

提出两阶段训练法AdaMame,通过自适应对齐推理语言与查询语言,实现多语言推理准确性与语言保真度的帕累托最优。

04:00
arXiv cs.CL

AmchiBias: 使用英语和孔卡尼语最小对数据集测量果阿身份群体中的刻板偏见

首个果阿刻板偏见基准显示多语言模型缺乏本地文化知识,孔卡尼接近随机,英语反映泛印度偏见。

04:00
arXiv cs.CL

一种面向长语音同步语音翻译的实用评估方法

提出长语音同步翻译评估法,用ASR与对齐计算延迟和质量,揭示现有系统在长语音上延迟积累严重。

04:00
arXiv cs.CL

CoCoGEC:面向鲁棒语法纠错的反事实生成

提出CoCoGEC框架,通过生成上下文变化的反事实实例,显著提升语法纠错模型鲁棒性,在多个数据集上取得大幅性能提升。

04:00
arXiv cs.CL

PACUTE:面向菲律宾语的音系、词缀与字符级词元理解

PACUTE基准揭示菲律宾语形态理解瓶颈:模型在构词组合任务上远低于字符级水平。

04:00
arXiv cs.CL

Ling与Ring 2.6技术报告:万亿参数级高效即时智能体智能

Ling-2.6优化即时响应,Ring-2.6侧重深度推理,通过混合注意力与KPop框架实现高效可扩展智能体智能,已开源。

04:00
arXiv cs.CL

适时停止:推理模型中的注意力状态自适应生成

提出ASAG方法,基于注意力状态自适应停止生成,无训练即插即用,准确率提升3.2%,生成token减少近40%。

04:00
arXiv cs.CL

中文标题:当认知图遇见大语言模型:恐慌情绪唤醒预测的BDEI认知路径

摘要:提出PanicCognitivePath框架,引入心理安全距离与BDEI路径,将LLM限制在单步参数估计,实现恐慌唤醒时间精度提升10.68%,峰值误差降至7.07%。

04:00
arXiv cs.CL

智能体能否读懂氛围?多模态模拟中的视觉社交智能基准测试

新基准AgentViSS评估多模态社交模拟的视觉智能,含240场景,发现角色表达趋饱和,交互管理更具挑战。

04:00
arXiv cs.CL

逐层稀疏性中超越层重要性:层间扰动吸收视角

发现层间扰动吸收现象,定义吸收系数并提出吸收感知修正,提升剪枝压缩效果。

04:00
arXiv cs.CL

重放关键内容:用于高效LLM强化反学习的离策略重放

提出ReRULE方法,通过离策略重放缓冲低奖励难例,提升反学习效率,保留质量从46.3改进至56.2。

04:00
arXiv cs.CL

Spokes:优化多样的预训练数据选择

提出基于G-Vendi分数的概率多样化框架,联合优化质量与多样性,在DCLM和FineWeb上分别提升1.5和1.4个点。

04:00
arXiv cs.CL

CHILLGuard:结合可扩展数据构建与模型感知偏好对齐的细粒度中文大模型安全护栏

针对中文场景提出5大类31小类风险分类,构建CHILLGuard安全护栏,通过可扩展数据管道与偏好对齐训练,F1提升15.92%。

04:00
arXiv cs.CL

基于解耦表示的分布式智能体协作隐私保护文本净化

DiSan框架解耦文本为角色与风格子空间,联合训练净化隐私,降低PII泄露20倍,保持83%忠实度。

04:00
arXiv cs.CL

超越单语深度研究:使用跨语言BrowseComp-Plus评估智能体与检索器

跨语言深度研究在检索和证据整合上均显著退化,XBCP基准揭示了检索失败与智能体侧困难。

04:00
arXiv cs.CL

重新思考高效注意力在混合架构中的作用

高效注意力主要影响长上下文涌现速度,全注意力主导长程检索,大窗口懒惰延迟检索头形成,NoPE可提升长上下文性能。

04:00
arXiv cs.CL

评估与保留英中语音到语音翻译中的词汇重音

提出英中S2ST词汇重音评估与保留方法,构建重音感知系统及客观指标,效果优于现有系统且与人类判断高度相关。

04:00
arXiv cs.CL

并非所有技能都有用:衡量与修复智能体知识

提出ASSAY框架,通过因果归因按任务屏蔽负面技能,显著提升LLM智能体性能,无需权重更新。

04:00
arXiv cs.CL

先验凌驾于证据:LLM二语发音反馈中的刻板印象驱动诊断

LLM发音反馈中,先验主导诊断,内部一致推理多支持错误评分,声学证据仅直接相关时有效,模型更善复述而非独立诊断。

04:00
arXiv cs.CL

利用思维链监督的强化学习用于仇恨与宣传模因的可解释检测

GRPO与CoT强化学习后训练提升模因检测分类与解释,FHM准确率+2.1%,ArMeme宏F1+7.6%

04:00
arXiv cs.CL

T-Mem:主动预判而非被动存档的记忆

T-Mem是首个覆盖描述性和关联性回忆的长期对话记忆架构,通过触发器预演未来场景,达到SOTA。

04:00
arXiv cs.CL

Pepti-Agent: 一种用于多肽设计与优化的人工智能代理

Pepti-Agent闭环AI代理通过可检测工具与语言模型控制器,实现多肽多性质约束的同时优化与追踪。

04:00
arXiv cs.CL

SHARD:通过自我重构蒸馏实现安全且有益的校准

SHARD自我重构蒸馏法:重写敏感提示并重构回答,提升安全性与有益性,性能媲美教师蒸馏。

04:00
arXiv cs.CL

Encode Errors: Representational Retrieval of In-Context Demonstrations for Multilingual Grammatical Error Correction

04:00
arXiv cs.CL

基于大语言模型的少样本生物医学关系抽取:监督学习的可行替代方案?

提示学习在macro-F1上超越监督基线(0.45 vs 0.38),尤其擅长稀有关系,但micro-F1仍较低(0.44 vs 0.56)。

04:00
arXiv cs.CL

让大语言模型互相评判:用于医学问答的多智能体同行评审推理

多智能体同行评审推理让LLM互相评判推理链,在医学问答中准确率达0.820,优于单模型和投票法。

04:00
arXiv cs.CL

面向FHIR问卷术语绑定的迁移学习

对比六种方法,BioLORD和对比微调各有优势,数据增强反降性能,错误主因是特异性与歧义。

04:00
arXiv cs.CL

ESBMC-PLC:基于SMT模型检测的IEC 61131-3梯形图程序形式化验证

首个开源原生梯形图形式化验证器,通过SMT模型检测与k-induction高效验证安全属性,发现8个bug。

04:00
arXiv cs.CL

Evaluative Judgement in Teaching AI-based Translation: A Class-room Case Study of AI-Mediated Translation and Post-Editing

04:00
arXiv cs.CL

AthDGC:一个开放的历时希腊语树库及其印欧语平行语料

首个开源多时期希腊语依存树库,新约与拉丁等四语对齐,提供端到端工作流。

04:00
arXiv cs.CL

LLM裁判存在暗电流:用于评估LLM作为裁判的心理测量信息表

引入裁判信息表协议测量暗电流等指标,揭示不同LLM裁判表现与判据移动而非分辨率提升。

04:00
arXiv cs.CL

基于LLM的科学话语立场检测:以贝叶斯认知科学为测试案例

LLM结合专家编码与提示优化,高效检测贝叶斯认知科学中的立场,实现高可靠性,并发现低层感知文章更倾向现实主义。

04:00
arXiv cs.CL

EHRNote-ChatQA:针对纵向出院小结的基于证据的多轮临床问答基准

首个针对纵向出院小结的基于证据多轮临床问答基准,揭示了LLM在证据推理与多轮问答中的挑战。

04:00
arXiv cs.CL

将示例蒸馏为任务指令:面向真实B2B对话的增强上下文学习

通过蒸馏示例为任务指令,减少99% token,AUC提升7%,实现鲁棒、高效的B2B对话分类。

04:00
arXiv cs.CL

扩展项目反应理论以实现高效且有意义的多语言评估

提出Multilingual-IRT框架,通过语言难度偏差与区分度分离,降低预测误差并发现翻译错误。

04:00
arXiv cs.CL

超越英语:揭示视觉-语言-动作模型中的多语言差距

研究发现VLA模型在多语言指令下性能显著下降,提出多语言主成分对齐微调方法有效缩小差距。

04:00
arXiv cs.CL

大型语言模型中的涌现性重新标记化对称性:现象学与应用

发现LLM部分涌现重新标记化对称性,可作探测工具与新型采样策略,恢复常规采样无法找到的解。

04:00
arXiv cs.CL

可检索的梯度:无累积权重漂移的持续后训练

提出ReGrad范式,以梯度为可检索知识单元,避免权重漂移,实现持续后训练,优于CPT和RAG。

04:00
arXiv cs.CL

Vernier:探究因果推理中词汇间隙背后的表征错位

Vernier揭示词汇间隙源于表征错位而非信息丢失,权重更新可对齐,但受模型与任务限制。

04:00
arXiv cs.CL

EIBench:基于模拟器的情绪管理基准与轮次信用强化学习方法

EIBench提出2222个场景的交互式情绪管理基准,并基于轮次状态反馈的CTC-GRPO方法提升LLM情绪智能。

04:00
arXiv cs.CL

基于自一致性的叙事问答重排序方法

提出自一致性重排序框架,通过多答案生成与语义一致性选择,显著提升叙事问答性能,最高提升14.57%。

04:00
arXiv cs.CL

ttda704在SemEval-2026任务6:用于政治回避检测的结构化思维链提示

比较参数高效微调与结构化思维链提示,最佳模型GroK-4-Fast在政治回避检测中取得0.5147 Macro F1,排名第8。

04:00
arXiv cs.CL

科舒尔变音符恢复器:一种用于克什米尔语变音符恢复的字节级序列到序列模型

提出字节级序列到序列模型恢复克什米尔语变音符,发布2.37万句子对,DERm达0.2012,专家准确率77.5%。

04:00
arXiv cs.CL

DYNA:持续学习中用时序知识图谱增强大语言模型的动态情景记忆网络

提出DYNA框架,用时序知识图谱作外部记忆,无需重训练即减少遗忘7%、提升时序排序5%。

04:00
arXiv cs.CL

中文标题:论自然语言处理中的擦除伤害定义

中文摘要:提出NLP中擦除伤害的结构化定义,明确建立和测量所需组件。

04:00
arXiv cs.CL

ttda704 在 SemEval-2026 任务4中:通过假名化和多视角句子对齐的叙事结构建模

使用对比学习与句子Transformer,通过单视角层冻结和多视角对齐建模叙事相似性,在合成数据上训练。

04:00
arXiv cs.CL

真实存于家族:通过模型谱系中继承的真实性头增强语境接地

研究发现LLM家族中真实度分数保持不变,提出TruthProbe策略增强语境真实性,减少多模态幻觉。

04:00
arXiv cs.CL

中文标题:当正确的边无法被验证:不完整KGQA中的溯源鸿沟与一种偏好溯源的补全策略

正确完成的边76-96%无文本支持,文本忠实性衡量溯源而非正确性;提出TGComplete策略,优先验证并放弃无支持边,提升精准度与忠实性。