9975 条条目 · 106 个活跃源
2026年8月7日
04:00
arXiv cs.CL

大语言模型对库与编程语言偏好的研究

LLM过度使用NumPy(45%非必要),偏爱Python忽视Rust等,需改进训练。

04:00
arXiv cs.CL

ECHO:可本地部署的智能健康助手,具备时间记忆、安全护栏与语音评估能力

提出可本地部署的慢病管理助手ECHO,集成ReAct工具调用、安全分层与语音情感评估,支持GDPR/KVKK合规,数据不出本地。

04:00
arXiv cs.CL

LangChoiceBench:衡量与解释大语言模型中的编程语言选择

新基准评测二十五种大语言模型发现Python过选、一致性低,推理多为自动或图省事,甚至虚构证据。

04:00
arXiv cs.CL

从孤立算法到合规优先的智能体平台:医院AI系统的多层架构

提出医院专属合规优先的多层智能体AI架构,整合编排、合规与隐私保护,模拟验证可降耗时、减文书,实现从零散工具转向治理化、全球合规的AI平台。

04:00
arXiv cs.CL

破折号嵌入国会:大语言模型时代初期(2021-2025)美国国会新闻稿中破折号频率的整体上升

美国国会新闻稿中无空格破折号使用率在2025年较前四年翻倍,超过预设阈值,但属群体标记而非因果证据。

04:00
arXiv cs.CL

GenGA:可编辑且基于数据的学术论文图形摘要生成

提出GenGA,直接生成可编辑矢量图形摘要,并设计SIC度量编辑简便性,效果优于传统方法和人工摘要。

04:00
arXiv cs.CL

通过具有保证的声明式智能体编程为语法约束解码学习上下文无关文法

提出自动文法智能体,从文档和执行数据学习上下文无关文法,实现近乎完美的语法约束解码,性能优于现有基线。

04:00
arXiv cs.CL

EdgeXpert:面向混合专家与推测解码的内存高效LLM推理边缘设备

软硬件协同,通过提示级专家复用与深度感知专家融合,解决推测解码与混合专家冲突,大幅降低延迟和能耗。

04:00
arXiv cs.CL

基于开放权重大语言模型的胸腹盆CT报告零样本多疾病标注:标注约定的影响

开放权重轻量LLM零样本标注CT报告优于规则算法与微调RadBERT,标注规范显著影响性能。

04:00
arXiv cs.CL

AV-AIVAT:不完美信息博弈中经认证的随时有效停止,实现74倍更廉价智能体评估

结合方差缩减与随时有效置信序列,实现不完美信息博弈中的认证早停;中位仅需七十四分之一对局,并支持第三方复核。

04:00
arXiv cs.CL

超越Top-K:用可解释智能体操作替代黑盒检索

README方法用确定性操作替代向量检索,在长文档数字问答上准确率58.8%,远超稠密检索15.7%,增益源于接口设计而非迭代。

04:00
arXiv cs.CL

HarnessOpt-Bench:评估LLM的Harness优化能力

提出评估LLM Harness优化能力的基准:优化器模型比编码框架更关键,原生框架无优势,提升空间大。

04:00
arXiv cs.CL

文本生成:任务、评估与挑战的系统文献综述

系统综述257篇论文,涵盖文本生成五大任务、评估方法及共性挑战,为研究者提供全景与方向。

04:00
arXiv cs.CL

基于生成式AI的架构引导分层信息提取与语义评估

提出架构引导的生成式人工智能框架抽取非结构化文本分层信息并自动语义评估F1超90%速度是人工30倍

04:00
arXiv cs.CL

将人类语言学洞察融入AI:多语言语音合成的理论驱动表示

融合语言学理论,采用FUL特征表示,多语言TTS仅需8小时数据即可生成可懂语音,100小时可合成未训练语言,支持混语合成。

04:00
arXiv cs.CL

大语言模型的解释揭示大脑中的语言表征

用可解释AI归因方法,发现LLM解释与大脑活动对齐,早期层对应听觉区,最终层对应位置信息。

04:00
arXiv cs.CL

思维状态:面向树状思维的结构化行动模板

提出可解释的推理时计算方法STATe,通过结构化行动模板搜索推理模式,提升生成多样性与可解释性。

04:00
arXiv cs.CL

利用弱验证器缩小生成-验证差距

提出一种框架,用弱监督整合多个弱验证器,显著提升推理与数学任务性能,以较小模型达到顶级推理模型水平。

04:00
arXiv cs.CL

Mapping Patient-Perceived Physician Traits from Nationwide Online Reviews with LLMs

04:00
arXiv cs.CL

通过智能体分解实现稳健的母语识别

提出法证语言学启发的智能体分解流程,汇聚语言证据并综合评估,显著提升母语识别对误导线索的稳健性与一致性。

04:00
arXiv cs.CL

逐层位置偏置:短上下文语言建模中的新发现

新框架逐层测量位置偏置,发现近因偏置随层深单调增强,首因偏置微弱递减,且功能词近因偏置高,内容词首因偏置高。

04:00
arXiv cs.CL

当大语言模型知晓表格:评估表格数据集数据污染的框架

提出表格数据污染评估框架,通过控制查询与统计检验,在8个数据集中发现4个存在污染,显示下游性能或虚高。

04:00
arXiv cs.CL

LELA:一种基于大语言模型的零样本领域自适应实体链接方法

LELA:基于LLM的实体链接方法,零样本跨领域适应,无需微调,性能媲美微调方法,优于非微调方法。

04:00
arXiv cs.CL

CPC-CMS:面向文档级情感分析的认知成对比较分类模型选择框架

提出CPC-CMS框架,用认知成对比较加权选最优模型。不计时间ALBERT最佳,计入时间无绝对最优。

04:00
arXiv cs.CL

预测社交媒体用户行为:面向Bluesky常见与罕见行为的混合预测方法

提出混合方法预测社交媒体常见与罕见行为,宏F1分别0.64/0.56,获COLM 2025挑战赛第一。

04:00
arXiv cs.CL

通过生成合成数据与去语境化用户问题构建开放检索式对话问答系统

为开放检索对话问答提出合成数据流水线,从文档生成对话,训练问题改写器去语境化,复用检索器并配合LLM作答。

04:00
arXiv cs.CL

LLM时代的内存:统一框架下的模块化架构与策略

提出统一框架,系统比较LLM智能体内存方法,设计新方法超越现有最优,并展望未来研究方向。

04:00
arXiv cs.CL

推理模型的测试时扩展对知识密集型任务尚不奏效

测试时扩展对知识密集型任务效果有限:增加计算不提升准确率,反增幻觉;长推理强化错误,无法引入新信息。

04:00
arXiv cs.CL

长上下文建模的不可能三角

长序列模型存在不可能三角:效率、紧凑性、线性召回不可兼得;满足前两者时召回有上限,证实无架构能逃脱。

04:00
arXiv cs.CL

可靠推理得出正确答案:语言模型的可验证过程监督

提出可验证过程监督(VPS),联合优化答案与推理,防止结果强化学习牺牲推理,提升准确性与可靠性。

04:00
arXiv cs.CL

同一任务,不同工作:提示词引发的编码智能体浪费

提示措辞决定编码智能体精力去向:多重路径/深度思考浪费推理,过度验证浪费工具时间,均无成功收益,限效措辞可避免。

04:00
arXiv cs.CL

强化目标语言特征:基于SAE的多语言推理引导

提出用预训练稀疏自编码器识别并增强目标语言特征,推理时无需训练即可提升多语言模型准确率。

04:00
arXiv cs.CL

社会模拟中语言模型的角色引导

提出角色激活引导筛选流程:在275角色上,角色特定方向优于基线,但38角色六维下降,需每角色选系数。

04:00
arXiv cs.CL

RESPClinBench:呼吸专科医疗中多模态临床决策与纵向疾病管理的基准评测

该呼吸多模态临床决策基准评估7个模型,发现肺结节影像幻觉与慢阻肺用药风险,为模型选择与验证提供依据

04:00
arXiv cs.CL

马普切语动词前的无屈折非派生词根:Wuno及其意义

马普切语动词前无屈折词根研究:历时语料显示三类特征,提出韵律-正字法假说,支持激进连接模型。

04:00
arXiv cs.CL

CRINN:用于近似最近邻搜索的对比强化学习

提出CRINN,用强化学习优化近似最近邻搜索,以速度为奖励,自动生成更快且高精度算法,多个基准最优

04:00
arXiv cs.CL

再看一眼:面向知识型视觉问答的免训练证据高亮

免训练框架利用模型内部注意力筛选并高亮证据,无需调整参数,在四个基准上平均提升多个模型最高12.5个点。

04:00
arXiv cs.CL

全象限有界裁剪GRPO:消除无界盲区,实现稳定与可泛化训练

提出ABC-GRPO,针对GRPO负优势与高似然比无界盲区,全象限有界裁剪,提升推理性能、熵保持及跨域泛化。

04:00
arXiv cs.CL

CREBench:评估大型语言模型在密码学二进制逆向工程中的表现

提出CREBench基准,含432个密码逆向挑战,评估大模型,最优得分64,人类92分。

04:00
arXiv cs.CL

CT Open:面向临床试验结果预测开放挑战的开放获取、无污染实时平台

CT Open每年举办预测挑战,用LLM防数据泄露,发布训练集和基准,可任意方法预测临床试验结果。

04:00
arXiv cs.CL

Token原生存储:以智能体的语言读写

用令牌ID存文本,免去每次重新分词,比UTF-8省2.25倍,解码可快7倍;呼吁统一共享词汇表。

04:00
arXiv cs.CL

行为金丝雀:审计强化学习微调中的私有检索上下文使用

行为金丝雀机制:偏好触发器与风格反馈检测RL微调未授权文档训练,1%注入率AUROC=0.756。

04:00
arXiv cs.CL

分布偏移下基于分阶段偏好优化的视觉语言模型幻觉缓解

提出分阶段偏好优化框架,构造幻觉偏好对训练DPO,减少视觉语言模型幻觉,提升视觉一致性。

04:00
arXiv cs.CL

在线推理校准:测试时训练实现可泛化的共形大语言模型推理

提出在线推理校准,结合共形预测与测试时训练,逐输入元学习校准采样,保证偏移下置信度,提升效率泛化。

04:00
arXiv cs.CL

MoDAl:面向语音神经假体的基于去相关的自监督神经模态发现

通过对比与去相关损失发现互补神经模态,将词错误率从26.3%降至21.6%,并利用布罗卡区信号提升解码。