10083 条条目 · 106 个活跃源
2026年7月15日
04:00
arXiv cs.CL

共享子电路让大语言模型跨任务进行倒计时

发现大语言模型中的通用倒计路子电路,可跨任务追踪剩余token数,并揭示其几何结构与跨模型共享基序。

04:00
arXiv cs.CL

FinResearchBench II: 一种基于共识衍生黄金评分准则的深度研究基准,用于区分财务报告质量

提出可扩展管道自动生成共识黄金准则,无需人类专家,有效区分10个金融深度研究系统性能。

04:00
arXiv cs.CL

LakeQuest:跨数据湖的接地问答三领域基准

LakeQuest基准含9846个QA对,覆盖三领域,揭示高检索不保正确推理,暴露跨模态合成关键失败模式。

04:00
arXiv cs.CL

超越二分类检测:Reddit癌症错误信息的多维分类框架

提出癌症错误信息多维分类法,发现Reddit约6%讨论含错误信息,少样本提示能提升分类性能。

04:00
arXiv cs.CL

评估低资源语言中的健康谣言:融合小型语言模型与文化敏感的责任自然语言处理框架(以孟加拉语为例)

针对低资源语言健康谣言,提出融合小型语言模型与文化敏感责任NLP框架,孟加拉语实验显示Phi-4最优。

04:00
arXiv cs.CL

面向文本到SQL的列级访问控制的策略条件约束解码

PCC-SQL通过逐token掩码强制列使用合规,实现0%泄露率、高达88.7%覆盖率,令牌增加不超过10%。

04:00
arXiv cs.CL

基于QUBO优化的证据选择用于非常规求解器的检索增强问答

将证据选择转化为QUBO优化,平衡相关性、覆盖度等,低能解得紧凑子集,性能媲美LLM选择器,兼容非常规求解器。

04:00
arXiv cs.CL

诱导情绪是否会偏倚大语言模型在序贯决策中的行为?

LLM能感知情绪,但平均上诱导情绪不显著影响决策;愤怒会降低惩罚敏感性和早期探索。

04:00
arXiv cs.CL

单词语境普查:44个语言模型答案选择的趋同现象

44个模型从大量选项中选词时41%选"serendipity",趋同显著,但不同模型差异超四倍,最新旗舰最趋同,而人格调优模型最不同。

04:00
arXiv cs.CL

分离、精炼、整合:将多模态融合分解用于情感分析

提出SeRIn方法,将多模态融合分解为分离、精炼、整合,解耦模态特定与跨模态交互,在情感分析基准上取得最优。

04:00
arXiv cs.CL

认知立场灵活性探测:测量大型语言模型中提示条件驱动的语域转换

提出ESFP基准测试,发现LLM的认知立场适应性独立于通用能力,立场内容密度是核心指标。

04:00
arXiv cs.CL

从Critic到Confidence:基于PPO的语言定量预测与置信度估计

CARE-PPO结合置信度估计与PPO微调,实现高精度预测与可靠置信,在医疗金融任务中优于基线并减少过拟合。

04:00
arXiv cs.CL

使用简洁的机器无关轨迹的语言识别

本文提出用简洁机器无关轨迹实现语言识别,只用小字母表,无需底层机器模型,突破了以往限制。

04:00
arXiv cs.CL

更少专家,更快解码:面向混合专家模型的开销感知推测解码

提出EcoSpec框架,通过成本感知的草案选择减少专家分散,提升MoE模型推理速度,最高加速1.62倍。

04:00
arXiv cs.CL

KnowAct-GUIClaw:深度认知与精准执行——具备自进化记忆与技能的个人GUI助手

KnowAct-GUIClaw框架通过积累经验实现跨平台GUI自动化,在MobileWorld基准上基于Kimi-2.6达64.1%最佳性能,超越GPT-5.5等闭源模型,且记忆技能可迁移提升8.5%。

04:00
arXiv cs.CL

翻译作为一种计算高效的桥梁:英文BERT在低资源语言中的可行性

翻译微调英文BERT在多数任务上效果可比或更优,对句法任务和相近语言有效,为低资源语言NLP提供高效路径。

04:00
arXiv cs.CL

WikiSTAR:揭示科学维基百科文章隐藏历史的系统

WikiSTAR用AI分类科学修订,交互追溯维基百科文章的知识演变历史。

04:00
arXiv cs.CL

从文字到控件:实现可控的LLM生成

提出可塑提示技术,将偏好转为GUI控件,用户配置引导生成并可视化影响,提升可控性与透明度。

04:00
arXiv cs.CL

PalmClaw:一个原生手机端代理框架

PalmClaw是手机原生代理框架,可直调设备能力,任务成功率提升11.5%,耗时缩减94.9%。

04:00
arXiv cs.CL

FAIR GraphRAG:一种面向语义数据分析的检索增强生成方法

FAIR GraphRAG融合FAIR数字对象与图检索,提升生物医学复杂问答的准确性、覆盖率和可解释性。

04:00
arXiv cs.CL

面向主权企业语言模型的本体增强蒸馏与语境性审计:一项机制证明与负面结果方法的联合研究

本体蒸馏模型性能持平GPT-5但未证明优越;语境性审计无显著信号。

04:00
arXiv cs.CL

QDEvo:一种用于自动化启发式设计的多目标质量-多样性框架

QDEvo集成LLM与分层自反思,维护语义多样存档,显著超现有方法,发掘高性能高效多样启发式。

04:00
arXiv cs.CL

LLM能否生成可靠评分标准?实验复现的元评估

首次元评估LLM生成论文复现评分标准,增强设置接近人类基线,但存在偏倚与适应性不足。

04:00
arXiv cs.CL

无知识语言模型:抑制参数记忆以实现基于证据的语言建模

匿名化实体预训练抑制参数知识,促使模型依赖上下文证据,显著提升问答、验证等任务的鲁棒性与校准性。

04:00
arXiv cs.CL

评估大型语言模型在多轮医疗对话中处理误解的能力

多轮对话中LLM纠正误解能力从85%降至50%,误差传播导致不安全风险。

04:00
arXiv cs.CL

中文标题:无参考答案时,LLM裁判易过度宽容

中文摘要:无参考答案时LLM裁判易高估错误回答,加入参考答案可改变判决达85%,需校准。

04:00
arXiv cs.CL

鲁棒性的错觉:聚合准确率掩盖了任务无关上下文下的预测翻转

任务无关上下文掩盖了模型个体预测的翻转,随机字符即导致性能波动,影响具模型特异性。

04:00
arXiv cs.CL

缺失之声:音频-语言嵌入模型难以处理否定

现有音频嵌入模型无法区分肯定与否定描述,新框架揭示其严重缺陷,需专门训练。

04:00
arXiv cs.CL

从成功流程中追溯智能体失败

提出OAT,仅用成功轨迹训练,通过神经受控微分方程建模动态,高效归因失败步骤,速度快、准确度高。

04:00
arXiv cs.CL

函数感知的中间填充作为编码智能体基础模型的中期训练

提出函数感知中间填充中期训练,提升编码智能体基准性能,并缓解后训练对非编码能力的侵蚀。

04:00
arXiv cs.CL

基于第一性原理的可提取记忆

通过匹配训练与非训练序列概率校准阈值,区分记忆与预测,验证可提取记忆的可靠性。

04:00
arXiv cs.CL

学习率门控的GRPO在小型语言-视觉语言模型Web代理中的失败:受控零结果及其机制

GRPO在小模型上无提升,仅在有改进空间时有效;失败归因于学习率门控的双重分离机制。

04:00
arXiv cs.CL

4B参数设备端深度研究:暴露限制忠实度,检索限制覆盖率

设备端4B模型研究:暴露决定引文忠实度,检索决定覆盖率;提高暴露可提升忠实度,但覆盖率受限于检索召回率。

04:00
arXiv cs.CL

优化并非万能

优化无法区分文本错误与创新,却已取代传统权威成为语言规范制定者。

04:00
arXiv cs.CL

GRID:面向企业SQL生成的语法约束解码

GRID基于LALR(1)解析器状态进行语法约束解码,保证语法正确、角色策略与安全审计,每token成本近恒定。

04:00
arXiv cs.CL

Code-MUE:通过基于执行的语义交互图测量代码大语言模型的不确定性

Code-MUE使用执行语义交互图计算冯诺依曼熵,量化代码LLM不确定性,与功能正确性强负相关(-0.98)。

04:00
arXiv cs.CL

我们真的需要超过10亿参数的多模态情感语言模型吗?

质疑大模型必要性,提出Light-MER轻量框架,通过知识蒸馏实现高效多模态情感识别,性能优越。

04:00
arXiv cs.CL

利用大型语言模型学习化学反应机理推理

构建反应机理推理数据集和基准,微调模型达8.3%精确匹配,超越专用模型,增强化学推理。

04:00
arXiv cs.CL

迷失迷宫:克服长周期自主搜索中的上下文限制

SLIM框架通过分离搜索/浏览工具及定期总结,以低成本、少调用实现长周期搜索性能提升8-6个百分点。

04:00
arXiv cs.CL

MemOps:长程对话中生命周期记忆操作的基准测试

MemOps将对话记忆重构为生命周期操作序列,通过操作级探针诊断记忆失败模式,超越传统问答评分。

04:00
arXiv cs.CL

谁给评估者打分?为自我改进的LLM代理共同演化评估指标和技能

提出双重棘轮方法共同演化指标与技能,使LLM代理在没有可靠指标时保留88-110%性能,并通过锚点和审计保障安全。

04:00
arXiv cs.CL

长出尾巴:提升大型语言模型输出多样性

大语言模型输出缺乏多样性,人类反应呈长尾分布;通过随机采样、多样化提示与模型聚合可改善,但不及人类,影响AI政策与文化多样性。

04:00
arXiv cs.CL

AI代理能否判断任务难易?迈向复杂度感知的推理与执行

提出E3方法,通过估计、执行、扩展实现任务感知,在保证成功同时削减成本85%、令牌91%、文件92%。

04:00
arXiv cs.CL

建模故事预期:使用大型语言模型的生成框架

用LLM生成想象的故事续写,提取情感等特征,验证与人类预期和实际结果吻合,并预测读者参与度。

04:00
arXiv cs.CL

FairCoder:通过编码任务探究LLM在高风险决策中的偏见

提出FairCoder基准和FairScore指标,通过编码任务揭示LLM在雇佣、教育等高风险决策中的隐性偏见。

04:00
arXiv cs.CL

催化剂代理:基于LLM代理的自主异相催化剂筛选

提出基于LLM的自主催化剂筛选代理,高效发现新候选材料,成功率远超随机筛选。

04:00
arXiv cs.CL

UXBench:评估AI助手的用户体验

提出首个基于真实用户反馈的AI助手体验评估基准,揭示模型感知与预测能力。

04:00
arXiv cs.CL

面向大语言模型评估的自适应测试:静态基准的心理测量替代方案

ATLAS基于项目反应理论自适应测试,减少90%项目,保持精度,能力估计可重建准确率。

04:00
arXiv cs.CL

预测检索!检索增强生成的测试时自适应

提出TTARAG方法,通过预测检索内容动态调整参数,显著提升RAG在专业领域的性能。

04:00
arXiv cs.CL

一种神经符号方法用于自然语言形式化与验证

ARc服务结合LLM与自动推理,冗余验证策略,实现超99%正确率和近零假阳性。