9836 条条目 · 106 个活跃源
2026年9月3日
04:00
arXiv cs.CL

减少伤害基准:评估大语言模型为药物使用者提供减害信息的准确性与安全性

首个针对药物使用者的减害信息基准,含2160组问答,发现先进大模型准确率不足且存在严重安全风险。

04:00
arXiv cs.CL

民主国家政治精英不文明行为日益加剧

分析26国议员1380万条推文:严重不文明占比5年内近翻倍至5.8%,民粹主义为主因,主流政党亦趋不文明,呈主流化。

04:00
arXiv cs.CL

SocialMaze:在复杂社会环境中评估与增强大语言模型社会推理的基准

社会迷宫基准:六任务,深度推理/动态交互/不确定性三维,评测十二模型:思维链助弱模型,微调增强结构化推理。

04:00
arXiv cs.CL

超越RAG:实时对话中的问题识别与答案生成

提出超越RAG的实时决策系统:先识别客户问题,FAQ直接匹配,否则经RAG生成,两秒内响应,降低人工成本。

04:00
arXiv cs.CL

GPTBIAS:评估大型语言模型偏见的综合框架

提出GPTBIAS框架,利用GPT-4评估模型偏见,提供偏见类型、群体、原因及改进建议,增强可解释性。

04:00
arXiv cs.CL

评估评估者:英语之外的摘要指标与LLM评委

构建多语言摘要元评估数据集,以多语言人工和模型摘要评测。专有大模型裁判最佳,开源裁判较差。

04:00
arXiv cs.CL

GMTRouter:面向多轮用户交互的个性化大模型路由

提出GMTRouter,用异构图建模多轮人机交互,通过图学习与采样机制从少样本中捕捉用户偏好,精准实现LLM路由个性化,性能显著优于基线。

04:00
arXiv cs.CL

从人类偏好中学习查询特定评分标准,用于深度研究报告生成

提出从人类偏好学习查询特定rubric生成器,其判别力优于基线,用作奖励信号显著提升深度研究报告生成性能。

04:00
arXiv cs.CL

CHisAgent:面向中国古代文化体系事件分类构建的多智能体框架

大语言模型在历史文化推理上能力有限,人工构建分类体系成本高。本文提出多智能体框架CHisAgent,分三阶段从史书语料自动构建古代中国事件分类,提升结构连贯性与覆盖度。

04:00
arXiv cs.CL

CARPAS:大语言模型摘要中所提供方面的内容感知精炼

提出基于文档内容动态调整给定方面的摘要新任务,发现模型过度生成方面,引入两阶段框架以提升聚焦性和性能。

04:00
arXiv cs.CL

大语言模型玩不了“猜词”:语言代理需具备私有工作记忆

理论证明仅靠公共对话历史无法维持隐藏状态,提出含显式私有工作记忆的架构,以恢复状态一致性。

04:00
arXiv cs.CL

Expos'ia:研究项目提案与同伴反馈的学术写作技能教学与评估

Expos'ia是首个连接高教写作与反馈的公开数据集,含提案和反馈评分。评测显示不同LLM各有优势,闭源优于开源,综合评分提示最有效。

04:00
arXiv cs.CL

大型语言模型中的文化根基人设:特征刻画及其与社会心理价值框架的对齐

探究大模型文化人设与全球价值观调查及道德基础框架的对齐,揭示其跨文化结构与道德差异。

04:00
arXiv cs.CL

CALIBURN:自校准的大语言模型遗忘对齐

提出自校准方法,以模型对不良知识的置信度调控遗忘梯度,实现精准遗忘并保持模型效能,减少对保留数据依赖,优于现有技术。

04:00
arXiv cs.CL

ChartAttack:检测大语言模型在图表生成中遭受恶意提示的脆弱性

提出“图表攻击”框架,揭示多模态大模型易受恶意提示生成误导性图表,降低问答准确率,微调可提升鲁棒性。

04:00
arXiv cs.CL

超越迁移准确率:面向低资源语言的机制引导可控适应

提出电路目标微调,仅更新任务相关头与层归一化,实现低资源语言可控适应,避免灾难性遗忘并保持源语言性能

04:00
arXiv cs.CL

通过检索-转换头桥接潜在推理与目标语言生成

研究发现多语言模型中存在检索-转换头,比检索头对思维链推理更关键,屏蔽后模型性能下降更显著。

04:00
arXiv cs.CL

GONE:通过邻域扩展分布塑形实现结构化知识遗忘

提出图知识遗忘基准GONE与NEDS框架,借助图连边区分记忆与邻域,遗忘效果与局部性俱佳。

04:00
arXiv cs.CL

CLASE:一种用于中文法律语言风格评估的混合方法

提出混合评估法,融合语言特征与大语言模型评分,从对比样本学习,更贴近人工判断,结果可解释。

04:00
arXiv cs.CL

平庸是LLM作为裁判的锚点选择的关键

锚点选择左右LLM裁判可靠性。最佳/最差模型作锚点不佳,平庸者反优;影响堪比裁判选择,需更大基准与有信息锚点。

04:00
arXiv cs.CL

通过作者画像探测大语言模型中的文化信号

研究发现大语言模型零样本从歌词推断歌手性别与种族时存在文化偏差,多数偏向北美,DeepSeek偏向亚洲,并引入公平性指标量化。

04:00
arXiv cs.CL

面向生物医学检索的模块化专家合并

合并独立训练的领域专家优于大规模混合域训练;STM用合成难负样本微调专家,生物医学检索强且通用性不降。

04:00
arXiv cs.CL

ICE:具有统计基础的干预一致性大语言模型解释评估

解释忠实性非固定属性,随干预算子变化;需同等随机基线与统计检验,否则漏检反忠实。

04:00
arXiv cs.CL

FDARxBench:针对FDA仿制药评估的监管与临床推理基准

面向FDA仿制药评估构建专家精选药物标签问答基准,揭示大模型在事实依据、长上下文与安全拒答上的短板。

04:00
arXiv cs.CL

用对数似然向量表示提示-响应分布的语言模型地图

以对数似然向量表示语言模型构建模型图,欧氏距离与相对熵近似成正比,可预测下游任务及提示组合效果。

04:00
arXiv cs.CL

评审审稿人:面向指南合规的LLM辅助反馈生成

提出LLM框架,分解审稿意见并识别违反ARR指南的问题,生成针对性反馈,违规减少92.4%;发布多标签数据集。

04:00
arXiv cs.CL

论视觉语言模型后训练中推理与感知的非对称优化

后训练对推理提升大于感知;分别源于SFT令牌失衡与RL奖励耦合,通过加权损失或感知奖励可提升性能。

04:00
arXiv cs.CL

GroupDPO:内存高效的分组直接偏好优化

提出内存高效的分组偏好优化,利用多响应对比超越单对训练;正响应对数似然项对性能和稳定性至关重要。

04:00
arXiv cs.CL

编程智能体能否复现计算材料科学中的研究发现?

提出新基准,评估编码智能体复现计算材料科学发现,最佳成功率仅53%,失败因流程不完整与方法偏差。

04:00
arXiv cs.CL

给它空间!编码器中位置与语义表示的显式解耦

将编码器解耦为语义、绝对位置与相对位置三流,仅优化语义流。绝对位置自发坍缩为低维流形,注意力头分工明确;解耦保留了位置信息,在65项语言现象中49项提升表征。

04:00
arXiv cs.CL

基于微调Transformer的多选题免应答难度建模:组件级表示与多任务学习

面向多选题的免应答难度建模,微调编码器联合处理文本,采用组件级编码与多任务问答,小训练集下优于基线。

04:00
arXiv cs.CL

人类标注在NLP中由谁完成?2018至2025年标注报告实践的大规模评估

首次大规模审计NLP论文标注报告,发现常用细节常缺,标注有效性信息遗漏多,报告质量随时间提升但仍不均衡,提出可扩展框架与最低报告建议。

04:00
arXiv cs.CL

MUDIDI:基于语言模型的多语词典数字化两阶段框架

提出两阶段框架,实现多语词典数字化,含人工标注数据,实验显示大语言模型最佳,并提供改进指南。

04:00
arXiv cs.CL

普适语感?用稀疏自编码器发现并控制语言无关的非正式语域

发现多语言模型内部存在跨语言共享的非正式语域子空间,通过激活这些特征可控制正式度并零样本迁移到多种语言。

04:00
arXiv cs.CL

最近发展区策略优化:教师置于提示中而非梯度中

提出ZPPO,将教师置于提示而非梯度,用正误候选问题重放硬题,超越离/在策略蒸馏和GRPO。

04:00
arXiv cs.CL

非英语论文是否得到公平评审?NLP同行评审中的研究语言偏差

首次系统刻画NLP评审中的研究语言偏差,发现非英语论文偏见率更高,负向偏见为主,且常被要求不合理的跨语言泛化。

2026年9月2日
04:00
arXiv cs.CL

轨迹裁判:仅看结果的LLM裁判在智能体轨迹评估中的盲区

仅看结果的裁判漏检45%静默故障,误报33%;逐步评分裁判静默召回77%且零误报,但成本3倍。评估需按结果存活分层。

04:00
arXiv cs.CL

基于真实行为的用户画像:用于个性化对齐与多视角推理

提出行为画像框架,从真实社交帖子提取用户画像,提升个性化对齐与多视角推理,超越合成画像。

04:00
arXiv cs.CL

科学智能体技能:面向研究智能体的程序性知识库

发布开放知识库,含16领域163项程序性技能,供研究智能体按需加载版本化指令文件。

04:00
arXiv cs.CL

GUI-CC:作为智能体环境的GUI世界模型上下文一致性基准测试

GUI-CC评估GUI世界模型作为智能体环境的上下文一致性,表明单步生成合理不等于多步模拟可靠。

04:00
arXiv cs.CL

基于LLM增强的音频-文本对齐的零样本呼吸音分类

利用医学LLM合成文本锚点,对齐呼吸音编码器实现零样本分类,平均AUC 61.3%,超越CLAP,线性探测达71.6%

04:00
arXiv cs.CL

CUDA-Harness:从自然语言驱动智能体CUDA内核生成与优化

提出CUDA-Harness框架,通过中间结构生成、合成验证和反馈自适应进化,实现从自然语言到高性能CUDA内核的可靠生成。

04:00
arXiv cs.CL

ValueGraph:价值信号引导的图预训练用于情境化用户表示

提出价值信号引导的图预训练框架,将推断道德价值作为软约束,学习情境化用户表示,在立场与机器人检测中优于基线。

04:00
arXiv cs.CL

从检测到拒答:电路引导的权重缩放使LLM更安全

电路引导权重缩放:检测头→安全神经元→拒答头电路,使攻击下安全率+26.5%,准确率-1.7%。

04:00
arXiv cs.CL

RePro:证明验证的基准重写,用于LLM数学问题求解的可靠评估

提出基于Lean证明验证的基准重写方法,确保题目与答案正确;实验显示模型性能下降,暴露记忆效应。

04:00
arXiv cs.CL

用大语言模型验证医学因果假设

评估8款大模型验证17项医学因果假设:召回率高,但证据支持与拒绝不实假设能力弱,医疗检索前须严苛评估。

04:00
arXiv cs.CL

合成世界:用于大语言模型的时间性评估与知识更新

提出合成模拟框架,生成虚构事件基准和训练方法,避免数据污染并实现稳健知识更新,性能提升14.23%

04:00
arXiv cs.CL

KItCAT:基于输入损坏的知识注入用于自回归训练

KItCAT通过在训练中随机替换部分输入词元,保持原标签不变,低成本增强数据,显著提升持续预训练注入专业知识的效率。

04:00
arXiv cs.CL

OCGQuant:面向NVFP4量化的离群伴随分组

提出后训练量化法:将离群通道与低幅伴随通道配对,优化激活块组成,困惑度最低且精度最佳,速度与内存接近基准方法。

04:00
arXiv cs.CL

差异之下:代码级自主研究循环中算法模式坍缩的诊断与缓解

自主循环现算法模式坍缩:编辑多样但机制趋同,指标虚高外部失灵。所提方法降语义坍缩近七成、增忠实度约八成。