10093 条条目 · 106 个活跃源
2026年7月15日
04:00
arXiv cs.CL

谁给评估者打分?为自我改进的LLM代理共同演化评估指标和技能

提出双重棘轮方法共同演化指标与技能,使LLM代理在没有可靠指标时保留88-110%性能,并通过锚点和审计保障安全。

04:00
arXiv cs.CL

长出尾巴:提升大型语言模型输出多样性

大语言模型输出缺乏多样性,人类反应呈长尾分布;通过随机采样、多样化提示与模型聚合可改善,但不及人类,影响AI政策与文化多样性。

04:00
arXiv cs.CL

AI代理能否判断任务难易?迈向复杂度感知的推理与执行

提出E3方法,通过估计、执行、扩展实现任务感知,在保证成功同时削减成本85%、令牌91%、文件92%。

04:00
arXiv cs.CL

建模故事预期:使用大型语言模型的生成框架

用LLM生成想象的故事续写,提取情感等特征,验证与人类预期和实际结果吻合,并预测读者参与度。

04:00
arXiv cs.CL

FairCoder:通过编码任务探究LLM在高风险决策中的偏见

提出FairCoder基准和FairScore指标,通过编码任务揭示LLM在雇佣、教育等高风险决策中的隐性偏见。

04:00
arXiv cs.CL

催化剂代理:基于LLM代理的自主异相催化剂筛选

提出基于LLM的自主催化剂筛选代理,高效发现新候选材料,成功率远超随机筛选。

04:00
arXiv cs.CL

UXBench:评估AI助手的用户体验

提出首个基于真实用户反馈的AI助手体验评估基准,揭示模型感知与预测能力。

04:00
arXiv cs.CL

面向大语言模型评估的自适应测试:静态基准的心理测量替代方案

ATLAS基于项目反应理论自适应测试,减少90%项目,保持精度,能力估计可重建准确率。

04:00
arXiv cs.CL

预测检索!检索增强生成的测试时自适应

提出TTARAG方法,通过预测检索内容动态调整参数,显著提升RAG在专业领域的性能。

04:00
arXiv cs.CL

一种神经符号方法用于自然语言形式化与验证

ARc服务结合LLM与自动推理,冗余验证策略,实现超99%正确率和近零假阳性。

04:00
arXiv cs.CL

设计上声明式,但仅依惯例可辅助:多智能体框架的AI可辅助性基准测试

惯例对齐驱动AI可辅助性,Agno得分最高(0.55),DSPy最低(0.07)。

04:00
arXiv cs.CL

Rethinking Evaluation in Retrieval-Augmented Personalized Dialogue: A Cognitive and Linguistic Perspective

04:00
arXiv cs.CL

数据生成过程中的层次潜在结构统一跨尺度的机制现象

研究发现,语言模型的三个神秘现象由数据生成过程的层次潜在结构、梯度去相关和表示几何凹性统一解释。

04:00
arXiv cs.CL

筛选推理分数:基于模型最自信轨迹的推理质量评估

提出FRS指标,仅用最自信的推理轨迹评估质量,能区分准确率相同的模型并反映可迁移推理能力。

04:00
arXiv cs.CL

大语言模型是否自知?基于信号检测理论的元认知效率测量

应用信号检测理论发现LLM置信信号具不等方差结构,元认知效率与准确性反向关联,且具领域特异性和温度解离现象。

04:00
arXiv cs.CL

面向语音用户界面的隐喻流动对话设计

提出隐喻流动设计,动态调整隐喻适配不同语境,提升用户接受度与愉悦感,但需个性化。

04:00
arXiv cs.CL

PerfCodeBench:面向系统级高性能代码优化的LLM基准测试

本文提出PerfCodeBench,评估LLM代码优化能力,发现模型与专家实现差距显著,尤其并行和GPU任务。

04:00
arXiv cs.CL

监督式金融NLP中的测量风险:基于JF-ICR的评分标准与度量敏感性

评分标准措辞改变标签,部分度量失效,需审计可识别度量才能得到可靠排名。

04:00
arXiv cs.CL

大型推理模型的自适应自蒸馏熵保持监督微调

CurioSFT通过自适应自蒸馏保持熵,增强探索能力,数学推理任务SFT提升2.5-2.9点,RL提升5.0点。

2026年7月14日
04:00
arXiv cs.CL

设计即忠实:评估与改进面向多方受众的LLM临床试验摘要

提出LLM临床试验摘要忠实度评估框架,发现“无依据主张”是主要错误,知识图谱增强检索显著提升忠实度。

04:00
arXiv cs.CL

非英语语言推理的代价:日语案例研究

训练日语推理模型可行,但性能不优于英语基线,且无助于文化相关任务。

04:00
arXiv cs.CL

工作负载驱动的设备端实时字幕翻译优化

设备端短输入字幕翻译,替换64k词汇tokenizer,嵌入校准与微调,胜率59.2%,速度提升1.63倍。

04:00
arXiv cs.CL

Index小语言模型技术报告

B站发布开源Index-1.9B小语言模型系列,在多项基准测试中性能优异,媲美数倍规模模型。

04:00
arXiv cs.CL

CLIR-Bench:对不规则临床时间序列的多模态问答进行基准测试

提出CLIR-Bench基准,用于评估不规则临床时间序列问答,揭示现有模型在稀疏证据推理上的不足。

04:00
arXiv cs.CL

RouteRec: 推荐智能体选择与聚合的严格评估

RouteRec框架表明,请求级硬选择效果不佳,项目级学习聚合在稀疏固定候选中更有前景。

04:00
arXiv cs.CL

基于语言模型的全球并购套利预测

结合专家引导与微调,语言模型预测并购套利结果,Brier分数降至0.151,优于市场与XGBoost。

04:00
arXiv cs.CL

量化大语言模型推理中的隐性失败:基于分类法的空洞收敛与失败模式转移分析

量化后准确率稳定,但推理出现空洞收敛与失败模式转移,标准评估无法检测。

04:00
arXiv cs.CL

大规模网络抓取语料中鲁棒、可扩展的文本包含检测

FindMyText利用匹配指纹序列链检测文本包含,可扩展至大型网络语料,性能优于现有方法。

04:00
arXiv cs.CL

高效适配口语语言模型至新加坡语境

提出LoRA微调与多任务适配方法,构建504k多语言QA数据集,5B模型超越7倍大模型,仅损失2%原始能力。

04:00
arXiv cs.CL

消除尼日利亚金融科技行业的结构性不平等

提出分层人机分诊模型,通过三阶段路由和动态影子价格消除结构性偏见,显著提升欺诈召回率并缩小区域差距。

04:00
arXiv cs.CL

同等精度,不等证据:搜索API作为工具使用代理的决策界面

三种搜索API准确率相近,但证据经济性差异显著,选择需权衡检索预算与策略。

04:00
arXiv cs.CL

超图的指令集与语言

提出IsalHG方法,将超图编码为指令字符串,贪心算法生成规范字符串,用于超图同构判定。

04:00
arXiv cs.CL

语言再生:信息局部性对重构影响的探究

研究信息局部性对语言模型重建自然语言的影响,发现恢复结构偏好更短依存距离,且难度随局部性破坏增加。

04:00
arXiv cs.CL

PolyInterview:基于大语言模型的沉浸式模拟面试平台与多模态评估

基于LLM的沉浸式模拟面试平台,生成个性化问题并全面评估多模态表现,提供行为证据与可行建议。

04:00
arXiv cs.CL

极化检测:面向低资源与高资源场景的AfroXLMR-Social与DeBERTa混合方法

本工作用DeBERTa检测英语极化,AfroXLMR-Social处理豪萨语及细粒度子任务,结合LoRA与数据增强,实现高效检测。

04:00
arXiv cs.CL

PTEI:整合人格特质以增强大语言模型的情商

PTEI框架通过提取人格特质并利用对比学习与链式推理,提升大语言模型情感理解能力,GPT模型准确率提高4%。

04:00
arXiv cs.CL

共识 vs 异议:群体推荐中主观偏好的动态LLM建模

微调LLM动态选择聚合策略,模拟人类对公平与共识的感知,提升群体推荐满意度。

04:00
arXiv cs.CL

一个机制对应多种心理空间:语言模型中基于值槽的共享路由器

语言模型通过共享值槽和空间索引路由器,实现了跨心理空间的统一控制机制。

04:00
arXiv cs.CL

哪些语言最能迁移到瓦勒皮里语?一项基于相似性的低资源ASR研究

结合声学与语言特征的相似性框架,发现声学相似预测微调性能,音位和类型学相似预测零样本迁移。

04:00
arXiv cs.CL

CAFE:一种复合AI因子评估框架

提出CAFE开源平台,通过因子设计评估复合AI系统组件对答案质量的影响,并分析效应与显著性。

04:00
arXiv cs.CL

结构化思维:提升推理与上下文剪枝

提出<try>/<outcome>块组织推理,微调提升8.08%性能,上下文剪枝节省85%内存,性能降8.67%。

04:00
arXiv cs.CL

无元数动作的非二叉自底向上成分句法分析

提出分隔符引导的非二叉树分析,消除元数动作,减少动作库存,性能持平基线,准确保留高元数成分。

04:00
arXiv cs.CL

用于长文档摘要的逐步提问专家-编辑器多智能体框架

本文提出专家-编辑器逐步提问多智能体方法,通过提问与线索引导改进长文档摘要,实验证明有效。

04:00
arXiv cs.CL

享受你的对话:一个以人为中心的多轮对话基准,采用解耦的用户模拟、目标建模与评判

EYT-Bench以人为中心,解耦用户模拟、目标建模与评判,发现模型客观意图跟踪差异达9倍。

04:00
arXiv cs.CL

当推理损害法律起草:专利权利要求生成中的言语化瓶颈

显式思维链导致信息瓶颈,降低专利权利要求生成质量;隐式思维链更优,因其避免关键细节抽象等三种损害机制。

04:00
arXiv cs.CL

使用转向解码的大型语言模型幻觉检测

提出转向解码法,主动挑战生成过程提取不确定性特征,高效检测LLM幻觉,性能优于现有方法。

04:00
arXiv cs.CL

清晰直觉还是真正分析?评估LLM作为评委的认知可靠性基准

基于双系统理论构建Kahneman4Review,发现LLM评委决策层级与文本质量不对齐,ICLR评审在LLM普及后出现诊断偏移。

04:00
arXiv cs.CL

UNIBROWSE: 面向多模态浏览理解的从数据到智能体框架

提出UniBrowse统一数据流水线,覆盖三种信息流模式,训练35B智能体在多模态浏览基准中平均准确率54.4,超越GPT-5等闭源模型。

04:00
arXiv cs.CL

大规模人口统计提示:更多属性何时损害LLM与人类一致性

高信号属性1-3个提升一致性,过多则降低;效果取决于属性质量、任务和模型。

04:00
arXiv cs.CL

MafiaScope:用于社交推理游戏中LLM代理的非侵入式、时间分辨信念探测

提出MafiaScope测试平台,通过私密探测揭示LLM代理信念轨迹,发现校准误差0.17,过度预测被怀疑1.5倍。