10153 条条目 · 106 个活跃源
2026年7月1日
04:00
arXiv cs.CL

SAGE:针对自由形式问答的大语言模型搜索增强评估方法

SAGE框架通过主动检索合成外部证据评估LLM输出,无需参考答案,与人工评估高度一致。

04:00
arXiv cs.CL

重新思考面向查询增强的在策略优化

本研究系统比较提示与强化学习查询增强,发现简单方法常优于RL,并提出混合方法OPQE。

04:00
arXiv cs.CL

双向过程奖励模型

BiPRM通过并行逆向评估与门控融合实现双向过程奖励,仅增0.3%参数,推理延迟5%,性能平均提升10.6%-37.7%。

04:00
arXiv cs.CL

提炼精髓:通过序列截断实现高效推理蒸馏

仅训练前50%的令牌可保留91%性能,减少50%训练时间、内存与算力。

04:00
arXiv cs.CL

自适应分配测试时计算会怎样?

提出验证器引导的自适应框架,通过PRM动态分配计算,在多个基准上显著提升性能。

04:00
arXiv cs.CL

InfiniteWeb:面向GUI智能体训练的可扩展Web环境合成

提出InfiniteWeb系统,自动生成大规模功能Web环境用于GUI智能体训练,在OSWorld等基准上显著提升性能。

04:00
arXiv cs.CL

FairJudge:一种自适应、去偏见且一致的LLM评判系统

FairJudge通过可学习策略和训练范式,实现自适应、去偏见且一致的LLM评判,显著提升性能。

04:00
arXiv cs.CL

Beyond Scalar Rewards: Dense Feedback for LLM Policy Synthesis in Sequential Social Dilemmas

04:00
arXiv cs.CL

BLUEX v2:对巴西大学入学考试开放式问题的大语言模型基准测试

BLUEX v2基准测试巴西大学入学开放式问题,评估21个LLM,发现数学推理与图像理解最困难。

04:00
arXiv cs.CL

RARE:面向高相似语料的冗余感知检索评估框架

现有评估忽视冗余,RARE通过分解事实和CRRF生成构建真实基准,揭示鲁棒性缺口。

04:00
arXiv cs.CL

共享的词汇任务表示解释大语言模型中的行为变异性

LLM提示敏感源于共享词汇任务表示,其激活程度解释行为变异,失败因竞争表示稀释信号。

04:00
arXiv cs.CL

多语种刑法法院中大语言模型的过度对齐测量与缓解

提出TF-RefusalBench基准评估多语刑事法律LLM过度对齐,发现abliteration有效缓解。

04:00
arXiv cs.CL

语言统计中的对称性塑造了模型表示的几何结构

语言统计的平移对称性决定模型表示的几何结构,鲁棒性源于潜在变量。

04:00
arXiv cs.CL

提问语言决定立场:语言条件引发的大模型分析争议政治文件中的意识形态分歧

语言而非内容决定大模型对争议政治文件的立场解读,俄语贬低、乌克兰语认可,模型无中立性。

04:00
arXiv cs.CL

使用语义向量模型在大型讨论平台上产生共识与分歧

通过语义向量模型和耦合参数,调控大型讨论平台上的共识与分歧平衡,实现凝聚与多样性可控管理。

04:00
arXiv cs.CL

使用引导向量的白盒敏感性审计

利用引导向量的白盒审计框架,通过模型内部测试发现黑盒评估遗漏的偏见,高风险任务中效果显著。

04:00
arXiv cs.CL

Teaching Models to Teach Themselves: Reasoning at the Edge of Learnability

SOAR框架通过元RL生成课程,在低成功率数据集上提升推理,发现问题结构比答案更重要。

04:00
arXiv cs.CL

ReplicatorBench:评估LLM智能体在社会科学和行为科学中可复制性的基准

新基准ReplicatorBench评估AI智能体在社会科学和行为科学中的研究复制能力,含可复制与不可复制声明。

04:00
arXiv cs.CL

人-智能体协作的论文到网页制作

AutoPage多智能体系统将论文转化为交互网页,15分钟内低于0.1美元,并具备验证机制。

04:00
arXiv cs.CL

GUI-AIMA: 基于上下文锚点对齐内在多模态注意力的GUI接地方法

提出注意力驱动的无坐标监督微调框架,通过多模态注意力对齐实现高效GUI接地,仅用50万样本即达3B模型最优性能。

04:00
arXiv cs.CL

语言模型中的演绎逻辑:水平推理与垂直推理

研究水平与垂直推理机制,发现思维链在水平推理中显式指导规则推理,垂直推理中起课程学习作用。

04:00
arXiv cs.CL

通过操作草图和自监督学习实现表格数据数值推理的泛化

TaNOS框架通过匿名化头部、操作草图与自监督预训练,提升数值推理跨域泛化,10%数据即达80.13%准确率,差距<2pp。

04:00
arXiv cs.CL

LLM作为评判者在物理评估中的有效性更多取决于任务而非模型

LLM评分有效性取决于任务结构和人类基准可靠性,而非模型能力;结构化问题与编程题表现好,论文评分差。

04:00
arXiv cs.CL

稀疏层是扩展循环语言模型的关键

循环MoE模型利用路由分歧激活不同专家,扩展性优于标准模型,且早期退出点更优,兼顾效率与质量。

04:00
arXiv cs.CL

INFUSER: 影响力引导的自我进化提升推理能力

INFUSER通过影响力分数指导生成器产出对求解器有益的问题,迭代提升推理性能。

2026年6月30日
04:00
arXiv cs.CL

现代BERT模型的法律领域自适应

对ModernBERT进行法律领域继续预训练,在法院意见数据集上显著提升,优于原始模型和从零训练。

04:00
arXiv cs.CL

使用信息抽取从阿拉伯语-英语机器可读词典中提取知识

提出利用n-gram和KWIC分析及规则抽取从机读词典自动提取词汇信息,同义词召回率高,其他信息精度高。

04:00
arXiv cs.CL

Transformer语言模型中情境建模与心理化的发展轨迹

LLM心理化能力随训练晚出现且脆弱,情境建模早于心理化但存在不一致。

04:00
arXiv cs.CL

面向特征发现与长上下文归因的轮次平均稀疏自编码器

轮次平均SAE用固定特征完整表示单轮对话,更全面描述高层特征且简化归因,适用长上下文。

04:00
arXiv cs.CL

一个用于临床训练的法语OSCE对话数据集及可控虚拟病人系统

提出法语OSCE对话数据集和可控虚拟病人系统,利用LLM生成对话,提升训练逼真度和评估一致性。

04:00
arXiv cs.CL

深度交错斐波那契间距的稀疏注意力:静态调度优于学习膨胀,在密集注意力失效处仍能外推

比较四种深度设置,静态逐层交错优于固定和学习;所有稀疏变体能外推至四倍训练长度,密集基线则崩溃。

04:00
arXiv cs.CL

手语模型的音韵感知

研究发现手语识别模型能感知音韵特征,但不同架构有偏好,训练范式无法突破归纳偏置。

04:00
arXiv cs.CL

SEAD: 基于熵引导监督的胜任力感知在线策略蒸馏

SEAD利用熵感知学生能力,自适应调整蒸馏策略,在数学基准上平均提升4.8%准确率。

04:00
arXiv cs.CL

极限生成中的无限幻觉

分析允许无限次错误但频率趋零的生成模型,发现可提升召回率,更贴近大语言模型实际。

04:00
arXiv cs.CL

错误理由下的正确编码?验证LLM作为理论构念的测量工具

LLM编码虽可靠但可能缺乏效度,粒度校准法通过分解构念验证其测量过程,而非仅看输出。

04:00
arXiv cs.CL

AnTenA:基于大语言模型的可操作可解释张量分析系统

利用大语言模型解释张量分解隐藏模式,无需标签或元数据,通过推理任务评估解释。

04:00
arXiv cs.CL

Structure-Preserving Document Translation via Multi-Stage LLM Pipeline: A Case Study in Marathi

04:00
arXiv cs.CL

DriftGuard:安全感知的多监测检测与选择性适应以应对不断演变的毒性内容审核

DriftGuard框架结合多监测器检测安全漂移,优先更新高风险样本,显著提升毒性召回率与准确率。

04:00
arXiv cs.CL

中文标题:5ting系统在SemEval-2026任务8:基于LLM重排序与忠实性控制的强端到端多轮RAG

中文摘要:提出结合BGE-M3检索、FAISS索引、双查询合并及LLM重排序的多轮RAG系统,任务A的nDCG@5达0.4719,任务C调和分0.5597。

04:00
arXiv cs.CL

良性多语言微调的安全影响的异质性

多语言微调时,安全影响因语言和模型而异,合规率可增四倍,仅英语评估不足。

04:00
arXiv cs.CL

多数投票压制少数价值观:HateXplain中仇恨/冒犯边界上的标注者分歧

标注分歧集中在仇恨/冒犯边界,多数投票导致模型准确率从80%骤降至58%,且无法恢复。

04:00
arXiv cs.CL

SEATauBench:将工具-智能体-用户评估适配到低资源东南亚语言

SEATauBench评估五种低资源东南亚语言智能体,发现仅对话本地化时能力迁移好,但全本地化大幅下降。

04:00
arXiv cs.CL

使用大语言模型标注实体匹配训练数据

大模型通过知识蒸馏生成训练数据,小模型性能与人工标注相当,成本低、速度快。

04:00
arXiv cs.CL

开放但不兼容:非洲低资源语言语料库的许可兼容性分析

审核非洲NLP语料库许可兼容性,发现四种冲突模式,如禁止衍生、误标许可,并提出合规清单。

04:00
arXiv cs.CL

内存管理的长上下文注意力:可编辑请求本地内存的初步研究

研究内存管理的长上下文注意力,混合方法优于纯固定或稀疏方法,但开放域选择仍是主要瓶颈。

04:00
arXiv cs.CL

PASTA: A Paraphrasing And Self-Training Approach for Knowledge Updating in LLMs

04:00
arXiv cs.CL

EVLA:面向物理认知驾驶推理与控制的电感知多模态助手

EVLA融合视觉、文本及车辆电状态,通过物理约束推理实现能量最优驾驶决策,准确率提升5.6%。

04:00
arXiv cs.CL

通过经验回放和模型汤对IndicTrans2进行21种印度语言的对话领域适应

使用经验回放和模型汤,IndicTrans2在21种印度语言对话chrF提升6.2,通用领域无下降,但人类评估未确认质量改进。

04:00
arXiv cs.CL

多表问答中的潜在桥接方法

GRAB管道通过图编码和潜在桥接,为冻结的LLM提供紧凑结构表征,高效提升多表问答性能。

04:00
arXiv cs.CL

大语言模型能公平招聘吗?简历筛选中的种族偏见

2024年后大语言模型招聘偏见方向逆转,从偏袒白人转为偏袒黑人或无偏见。