10213 条条目 · 106 个活跃源
2026年5月29日
04:00
arXiv cs.CL

AFRILANGTUTOR:利用大语言模型推进低资源语言的辅导与文化教育

为低资源非洲语言构建大规模词典及训练数据,微调多语言模型提升语言辅导性能,效果提升1.8%-15.5%。

04:00
arXiv cs.CL

面向专业领域的基准构建与评估框架:以防务相关文档为例

提出DoRA框架,用少量专业文档生成合成QA,微调后性能提升,幻觉减半。

04:00
arXiv cs.CL

多囊卵巢综合征与饮食失调并存:一种可解释性AI方法检测隐藏的三重负担

开发可解释AI模型检测PCOS女性三重负担,准确率75.3%,适用于筛查。

04:00
arXiv cs.CL

生命周期内存控制中的保留后果

研究持久内存写入后的失败问题,提出以强度作为显式保留后果状态,维护期间需保持有效性和保留后果可用性。

04:00
arXiv cs.CL

早期决策至关重要:非自回归扩散语言模型中的邻近偏差与初始轨迹塑造

非自回归扩散语言模型因邻近偏差导致错误传播,通过引导早期令牌选择可显著提升推理性能。

04:00
arXiv cs.CL

负面优势是一把双刃剑:为搜索智能体校准GRPO中的优势

CalibAdv通过精细化降级过度负面优势并平衡正负,提升GRPO搜索智能体训练稳定性与性能。

04:00
arXiv cs.CL

三元逻辑问答的组合一致性引导解码

提出CGD-PD方法,通过组合一致性与符号投影,提升LLM在三元逻辑问答中的准确率并减少未知预测。

04:00
arXiv cs.CL

BenGER平台:用于德国法律任务端到端基准测试的协作式Web平台

BenGER开源平台整合任务创建、协作标注与多指标评估,提升法律基准测试的透明度与可重复性。

04:00
arXiv cs.CL

语法即罗塞塔石碑:面向上下文科普特语翻译的通用依存关系

结合通用依存句法与词典的上下文学习,显著提升科普特语英译性能,达最新最优。

04:00
arXiv cs.CL

评估评估者:SemEval-2020任务1在词汇语义变化检测中的问题

SemEval-2020任务1因操作化狭隘、数据质量差和设计有限,仅作部分测试,需完善理论、预处理和跨语言覆盖。

04:00
arXiv cs.CL

通过共识驱动偏好优化缓解大语言模型跨语言文化不一致性

提出跨语言文化不一致度量κ_S及C-3PO对齐框架,有效提升模型一致性,尤其改善低资源语言表现。

04:00
arXiv cs.CL

面向大型语言模型的结构化智能体蒸馏

提出结构化智能体蒸馏,按推理/行动片段对齐,压缩LLM智能体,性能损失小,显著降低开销。

04:00
arXiv cs.CL

异构依赖图引导的注意力机制用于专利表示学习

PHAGE模型通过异构依赖图区分法律引用与技术关系,利用可学习偏置融合权利要求层级,提升专利分类、检索与聚类性能。

04:00
arXiv cs.CL

iPOE:基于解释的可解释提示优化

iPOE利用解释生成指南优化提示,提升性能39%,实现可解释性且人机高度一致。

04:00
arXiv cs.CL

苹果智能基础语言模型

苹果推出约30亿参数设备端模型及大型服务器模型,高效准确负责任执行任务,聚焦负责任AI。

04:00
arXiv cs.CL

语言模型需要睡眠吗?离线递归以改进在线推理

模型通过离线递归更新快速权重,将计算转移至睡眠阶段,提升长上下文在线推理性能,尤其在深层推理任务上。

04:00
arXiv cs.CL

UKP_Psycontrol在SemEval-2026任务2:从文本建模效价与唤醒动态

本文提出三种方法建模文本情感动态,发现LLM捕捉静态情感,短期变化依赖数值轨迹,系统在任务中夺冠。

04:00
arXiv cs.CL

通过几何调控逃离大语言模型生成中的模式坍缩

几何调控方法(RMR)通过低秩阻尼干预Transformer值缓存,减少模式坍缩,实现低熵稳定生成。

04:00
arXiv cs.CL

遵从性与感知性:论大语言模型的推理可控性

LLM优先遵循任务合适的推理模式而非指令,推理冲突可检测,激活控制可提升遵从性达29%。

04:00
arXiv cs.CL

少即是多:面向大语言模型的几何反学习与最小数据披露

几何反学习仅用少量合成数据,无需原始训练集,即可高效移除特定内容,保持模型性能。

2026年5月28日
04:00
arXiv cs.CL

ICG:基于MLLM提示和个性化偏好对齐改进封面图像生成

提出ICG框架,利用MLLM提示与个性化偏好对齐生成高质量封面,无需标注数据,显著提升图像质量和个性化效果。

04:00
arXiv cs.CL

LCO:基于大语言模型的约束优化,增强真实世界任务中LLM智能体的安全性

提出LCO框架,通过自思考和进化采样减少LLM智能体的上下文奖励黑客行为,在提升安全性的同时保持任务性能,实验有效。

04:00
arXiv cs.CL

解锁基于提示的文本转语音模型中细粒度和话语内说话风格控制

提出话语间风格插值与话语句内风格转换技术,实现平滑过渡,性别转换成功率99-100%,音高变化达36Hz。

04:00
arXiv cs.CL

RAG-Coding:利用结构化外部知识增强大语言模型医学编码

提出RAG-Coding方法,通过整合外部知识源提升ICD编码准确性,在MDACE数据集上F1值提升8-13%。

04:00
arXiv cs.CL

BioELX:基于别名检索和LLM排序的跨语言生物医学实体链接

BioELX无需标注数据,通过多语言别名检索和LLM排序实现跨语言生物医学实体链接,在多个基准上取得新SOTA,低资源语言提升显著。

04:00
arXiv cs.CL

OralAgent:整合推理、工具与知识的交互式牙科图像分析

首次提出牙科专用AI代理OralAgent,统一推理、工具与知识,融合22种工具和368本教科书,在多项基准上达最优。

04:00
arXiv cs.CL

弥合稳定性-表现力差距:低资源口语语言模型的合成数据扩展与偏好对齐

针对合成数据导致的稳定性-表现力差距,提出自对齐框架(DGSA与TDSC),优于商业系统并实现老挝首个零样本语音克隆。

04:00
arXiv cs.CL

从自回归到扩散:通过严格因果和弹性视野高效适配大型语言模型

FLUID用严格因果对齐复用AR模型,引入弹性视野动态去噪,实现高效并行文本生成,性能SOTA且训练成本极低。

04:00
arXiv cs.CL

通过反应语气建模社区态度:评估LLM与在线社区语言行为一致性的AI人机协作框架

提出CARE框架,通过细粒度语气谱系评估LLM模拟与真实社区反应的一致性,揭示“现实主义差距”。

04:00
arXiv cs.CL

EvoSpec:通过实时词汇与参数自适应演化推测解码

EvoSpec采用动态词汇与参数自适应实时演化草稿模型,专业领域加速1.13倍,内存降低27%

04:00
arXiv cs.CL

事实的未来:追踪生成-验证差距

语言模型验证能力先于生成且更鲁棒,事实更新导致新旧答案共存。

04:00
arXiv cs.CL

StoryMI: 可控多智能体治疗性对话生成

StoryMI多代理框架通过情境故事与策略控制生成动机访谈对话,提升临床合理性。

04:00
arXiv cs.CL

英译印地语中的文化保真度:性别可恢复性的保真度-流畅性前沿

研究揭示英译印地语中保留性别线索需在保真度与流畅性间权衡,无单一最优解。

04:00
arXiv cs.CL

PAST2HARM:一种简单的自适应过去时攻击以越狱多模态AI

提出自适应过去时攻击绕过多模态模型防御,在三个模型上成功率67%-100%,生成多种有害内容,暴露安全漏洞。

04:00
arXiv cs.CL

Debate Helps Weak Judges Reward Stronger Models

04:00
arXiv cs.CL

Simorgh在SemEval-2026任务7:面向低资源文化推理的多语言问答区域感知混合检索

提出区域感知混合检索,结合BM25与稠密语义,提升低资源文化问答跨语言稳定性,但未完全克服数据不平衡。

04:00
arXiv cs.CL

学习将软提示翻译为硬提示

提出软提示到自然语言的翻译模型,提升可解释性与性能,大型模型上表现更优。

04:00
arXiv cs.CL

幻觉也能有用?用SLM通过链式系统I/II推理解决多跳问题

利用幻觉有益性,提出先答后思的链式推理框架,优于传统先思后答。

04:00
arXiv cs.CL

Keyphrase Generative Representation of Youth Crisis Conversations Beyond Static Taxonomies

04:00
arXiv cs.CL

厘清多语言LLM任务执行中的语言角色

引入MTM-Bench基准,发现响应语言角色是性能退化的主因,单个响应不匹配即可造成大部分退化。

04:00
arXiv cs.CL

模型知道它们为何改变想法吗?在知识冲突下思维链的可解释性与忠实性

知识冲突下,模型思维链高度稳定,自信度有微弱信号,内部思考更敏感,应信任自信而非论证。

04:00
arXiv cs.CL

UserHarness:驾驭用户心智以增强智能体心智理论

UserHarness通过显式重建用户心智状态,实现更优的心智理论推理,相对准确率提升超15%。

04:00
arXiv cs.CL

UNIQUE:通用Top-k稀疏注意力机制,用于免训练推理与稀疏感知训练

提出UNIQUE框架,通过页面均值和标准差评分及软掩码训练实现高效稀疏注意力,加速11.4倍且保持性能。

04:00
arXiv cs.CL

逃离语言先验:通过模态感知策略优化缓解音频推理中的后期模态崩溃

提出MAPO框架,用动态梯度聚焦和注意力损失抑制模态崩溃,在音频推理中达到新SOTA。

04:00
arXiv cs.CL

阅读还是猜测?视觉语言模型在古希腊文献OCR中的视觉基础失败

VLM在低资源古希腊文献OCR中产生流畅但无视觉依据的错误,依赖语言先验,需可解释性评估。

04:00
arXiv cs.CL

基于链的格点自适应重构用于减少幻觉

提出CAROL框架,通过语义一致性与马尔可夫链迭代优化,有效减少大语言模型幻觉,提升可靠性与效率。

04:00
arXiv cs.CL

UniMaia:用语言引导国际象棋策略以实现类人化对弈

UniMaia框架通过语言提示控制冻结的Lc0策略网络,实现类人对弈,无需多模态训练,平衡可控性与性能。

04:00
arXiv cs.CL

ReverseMath: 面向可扩展且可验证的数学问题生成的答案反转方法

ReverseMath通过答案反转生成可验证数学问题,揭示模型记忆行为,并作为数据增强提升推理性能。

04:00
arXiv cs.CL

TRACES: 通过轨迹状态建模的多轮LLM代理主动安全审计

TRACES提出基于表示的主动审计方法,通过轨迹状态建模和弱监督学习实现前缀级风险估计,提升多轮LLM代理安全预测能力。

04:00
arXiv cs.CL

超越输入理解:使用有向无环迹图诊断多语言数学推理

语言不仅影响问题理解更影响推理执行,提出DATG诊断框架及两种方法提升低资源语言推理性能。