9816 条条目 · 106 个活跃源
2026年9月7日
04:00
arXiv cs.CL

基于低秩注意力适配的量化KV缓存质量恢复

低秩注意力适配可恢复量化KV缓存的困惑度损失(如54%-76%),但未必恢复长上下文检索。

04:00
arXiv cs.CL

评审能力决定拒稿目标,而非修复技巧:来自LLM执行-审查-修订流程的证据

更换不同能力审查模型,跨系列中端审查提升准确率12%,同模型自审误拒率高但修复率低。核心是审查能力而非修复技巧。

04:00
arXiv cs.CL

LexFlip:一种法律意义保持度量的解离诊断

分离诊断:373个保留词元却反转法律效力的扰动下,词嵌入度量几乎失灵,双向NLI有效,长度特征最准。

04:00
arXiv cs.CL

EVOHARNESSBENCH:智能体能否跟上不断演化的工具框架?

提出EVOHARNESSBENCH,评测工具/技能/智能体框架演化;发现框架扩展会遗忘旧任务、适应增益不稳、保持与适应相互冲突。

04:00
arXiv cs.CL

多语言口述历史研究中的自动语音识别

Whisper对社区粤语口述史转写有效,但对非英语混用段转写不准;仅用约百分之一时间即可出初稿。

04:00
arXiv cs.CL

重复提问会耗尽LLM的品牌推荐,但不会耗尽其来源

重复提问是否耗尽品牌推荐取决于检索方式。无检索引擎到第15轮仍在新增品牌,检索引擎则趋于饱和;引用域名持续增加,单一运行仅覆盖部分品牌集。

04:00
arXiv cs.CL

知道何时不回答:音乐音频-语言模型中的伪集成弃权方法

通过打乱选项顺序构建伪集成,无需重训即可让模型弃权,提升准确率与误差排序能力。

04:00
arXiv cs.CL

网络意图转换的不确定性信号:风险排序与歧义定位

用预测不确定性和词元熵,分别对生成网络配置进行风险排序与歧义定位,实验有效但校准不足。

04:00
arXiv cs.CL

面向多模态推荐的潜在对齐推理

提出LARK两阶段潜在对齐推理:视觉检查点与推理状态对齐缓解跨模态稀释,在多模态推荐上取得最优。

04:00
arXiv cs.CL

JLIR:Julia原生的受MLIR启发的中间表示,具备自动JACC内核提取

JLIR是一种Julia原生的类MLIR中间表示,支持部分类型程序与方言扩展,用于自动JACC内核生成。

04:00
arXiv cs.CL

每神经元至多一次脉冲的大型语言模型

提出TTFS参考编码构建全脉冲LLM,达15亿参数;NLU/常识推理媲美ANN,困惑度仍有差距。

04:00
arXiv cs.CL

利用知识单元间的潜在距离测量生物医学论文的新颖性

提出融合网络、语义、层级三种知识单元关系的创新度测度,优于传统指标,综合三类距离更能识别新论文。

04:00
arXiv cs.CL

面向建筑能源系统暖通空调运行的大语言模型:方法、应用与部署就绪度评述

综述66项LLM暖通空调研究:仅4项试点级,零部署;LLM适作语义/工作流层,非自主控制;需现场验证与安全架构。

04:00
arXiv cs.CL

你的智能体记忆能否经受模型升级?一项关于记忆可移植性的受控研究

固定模式知识图谱迁移可靠;压缩笔记高度依赖模型;混合嵌入检索收益有限;保留原始历史是修复关键。

04:00
arXiv cs.CL

利用推理经济性:大语言模型高效推理综述

综述大模型推理经济性,分析低效原因、行为模式,提出平衡性能与算力的策略。

04:00
arXiv cs.CL

ConfRAG:置信度引导的检索增强生成

ConfQA微调将幻觉率降至5%以下,ConfRAG仅在不确定时触发检索,理想准确率超95%,减少30%以上无效检索。

04:00
arXiv cs.CL

Transformer语言模型上下文个体化测量工具包技术手册

介绍桥式形式工具包,测量语言模型按上下文区分词义的能力,详述流程并规避偏差。

04:00
arXiv cs.CL

QoNext:迈向基础模型的下一代体验质量

首个将网络与多媒体QoE原理引入人机交互评估的框架,构建数据库并训练模型,从系统参数精准预测用户体验。

04:00
arXiv cs.CL

面向韩国开放公共API的多步工具调用:基准与数据合成方法

提出KOPA-Bench基准与EDGE数据合成法,经GRPO微调9B模型,性能接近27B模型,在KOPA-Bench和BFCL上显著提升。

04:00
arXiv cs.CL

仿生人会梦见幕后操纵者吗?探究大语言模型中的阴谋论倾向

大语言模型展示部分阴谋信念,存在社会人口偏见,且易被提示词引向阴谋论,凸显被操纵风险。

04:00
arXiv cs.CL

多语言模型用于检测值得核查的社交媒体帖子

研究Transformer模型,开发多语言多标签分类器,可同时高效检测社交媒体中的可核实事实声明和有害声明。

04:00
arXiv cs.CL

同一轨迹,矛盾奖励(ROBORMBENCH):视觉语言奖励模型中的释义脆弱性

视觉语言奖励模型缺乏释义不变性:改述指令即可改变评分甚至翻转成败,专用模型更稳定,释义鲁棒性至关重要。

04:00
arXiv cs.CL

探索解法分歧及其对大语言模型问题求解的影响

研究发现解法分歧与解题能力正相关,作为新指标可提升监督微调与强化学习成功率。

04:00
arXiv cs.CL

面向句子级与上下文感知机器翻译的交叉偏好学习

提出交叉偏好学习框架,融合句级与上下文翻译优势,显式建模上下文效用,无需改动架构即可提升翻译质量与鲁棒性。

04:00
arXiv cs.CL

标签承载人类价值:主观任务的价值校准

提出多校准主观任务学习框架,识别潜在价值群体并实施价值条件校准,在多项主观任务上优于基线。

04:00
arXiv cs.CL

智能体上下文裂解:通过非结构化数据的自适应结构化实现令牌高效的数据推理智能体

提出智能体数据裂解:按需自适应投机式结构化已加载上下文,后续相似查询直接走结构数据,大幅降本且保精度。

04:00
arXiv cs.CL

PROMPT2BOX:通过揭示提示间的蕴含结构改进大语言模型弱点发现与特异性估计

提出Prompt2Box盒嵌入方法,利用提示蕴含关系提升特异性估计与弱点发现。

04:00
arXiv cs.CL

基于Kolmogorov-Arnold网络与视觉语言基础模型的YOLO可解释目标检测:面向可信多模态AI的计算机视觉感知

提出KAN可解释后验模型,评估YOLOv10检测可信度,结合BLIP场景描述,在COCO和校园图像中有效识别模糊、遮挡等低置信预测。

04:00
arXiv cs.CL

中文标题:人机共生中增强与自动化视角下的角色感知人工智能

中文摘要:研究AI在人机共生中的功能角色追踪,提出推断和嵌入角色方法,实验验证能有效区分辅助与创作角色,助力AI伦理。

04:00
arXiv cs.CL

自回归多特质作文评分的特质感知策略优化

提出TAPO后训练框架,沿样本与特质分解奖励,整合一致性、特质精度与格式约束,提升作文多特质评分。

04:00
arXiv cs.CL

科学领域知识提升眼底视觉语言模型

构建眼底图文数据集,微调对比显示领域文献优于医学报告,性能提升源于领域密度。

04:00
arXiv cs.CL

TeleTables:面向电信表格理解的大语言模型基准

电信表格基准:数千标准表、五百问答题。二十模型闭卷不足四成,给表后达九成,但推理/结构越复杂性能越降,专用无益。

04:00
arXiv cs.CL

NOTAI.AI:基于曲率与特征归因的可解释机器生成文本检测

NotAI.AI是可解释机器生成文本检测系统,融合条件概率曲率、神经评分与风格特征,用TreeSHAP归因,RAID测试F1达0.9685,解释忠实。

2026年9月4日
04:00
arXiv cs.CL

基准污染虚增分数但极少改变大语言模型排行榜排名

基准污染抬高绝对分数却几乎不改变模型排名,仅污染不均时可能扭曲排行榜。

04:00
arXiv cs.CL

框架优化价值存在于何处?自进化大语言模型智能体中的局部收益与预算均分陷阱

框架优化价值具局部性;反思/控制槽贡献最大,均匀分预算有害,集中预算可提升至0.761。

04:00
arXiv cs.CL

R²Adapter:用于高效混合RAG的路由与重写适配器

提出R²Adapter,轻量即插即用,路由并重写查询,降低59%图RAG调用,保持精度。

04:00
arXiv cs.CL

冻结智能体:有界人设在分类上媲美检索,回归上则不及

提出无训练法PersonaLink递归蒸馏有界人设;分类上准确率0.75与检索无差异,回归上则逊色。

04:00
arXiv cs.CL

PiPMRE:基于语言模型的医疗关系抽取流水线

提出基于语言模型的医疗关系抽取流水线PiPMRE,由关系生成器与过滤器组成,无需标签模式,在两个公开数据集上平均提升5.6召回率和4.4准确率。

04:00
arXiv cs.CL

BharatGather:面向印度公共事件中虚假信息与假新闻检测的文化感知基准数据集

针对印度大型公共事件,构建含14646条记录的多源数据集,融合事实核查与合成增强,用于文化感知的虚假信息检测基准。

04:00
arXiv cs.CL

面向OOD欺骗检测的探针泛化:子空间选择

将激活投影到主成分子集可实现跨域欺骗检测迁移,用LLM评分选择可迁移方向,显著缩小基线到上限差距。

04:00
arXiv cs.CL

裕度而非窗口:免训练的逐步骤有损推测解码

提出无需训练的逐步骤推测解码法,动态调整验证规则与草稿树形状,吞吐量最高提升56%,近乎无损。

04:00
arXiv cs.CL

反例作为智能体自我纠正的反馈

A-CEGIS以反例反馈评估多轮正则修正,四轮内解决90%,最终全解,平均2.7轮,77%稳健。

04:00
arXiv cs.CL

蒸馏快速嵌入迁移(DRET):基于优先级嵌入迁移的参数高效生物医学领域自适应

该技术从专用大模型向小模型迁移知识,使小模型无需重训即在生物医学分类上媲美十倍大模型,并保持高效。

04:00
arXiv cs.CL

双形式ASR:面向中文语音识别的语义感知逆文本规范化

提出DF-ASR框架,通过成对监督与序列级目标,同时支持口语与书面形式输出,在中文测试集上优于开源ASR-ITN系统。

04:00
arXiv cs.CL

统一语境下的语言任务与上下文集成

提出Conformal Relevance框架,用上下文学习与集成构造评分函数,在保证覆盖度时提升简洁性,减少人工提示工程,适用于七项NLP任务。

04:00
arXiv cs.CL

聆听潜在表征:通过隐藏状态交互在大型音频语言模型中的自纠正语音识别

提出Hybrid Search,利用ASR与基础LLM的隐藏状态交互特征,精准纠正高语义依赖词元,提升语音识别性能。

04:00
arXiv cs.CL

审思“以LLM为评审”:基于LLM的自动文本生成评估中的评分标准伪影问题

仅凭评分标准文本训练的模型即可预测评判结果,说明评分标准含有评估信号,导致LLM评审可靠性存疑。

04:00
arXiv cs.CL

Jina-OCR-v1:结合推测解码与稠密可验证奖励的高效文档解析

低算力显卡上的端到端文档解析模型,结合压缩视觉编码与推测解码,采用稠密可验证奖励训练,精度高且速度快。

04:00
arXiv cs.CL

大语言模型解决上下文知识冲突研究

提出六类上下文冲突和数据集,评测九种大模型仍欠佳;发现早期证据偏好,提出免训练引导法以改善冲突解决。

04:00
arXiv cs.CL

RL-ADA:一种面向对抗鲁棒企业对话代理的世界反馈框架

无标注RL-ADA以世界反馈驱动代理对抗共进化,银行客服路由错误消除、通过率翻倍,涌现上下文伪装。