9926 条条目 · 106 个活跃源
2026年8月19日
04:00
arXiv cs.CL

多语言大语言模型生成文本中的翻译腔研究

探究多语言大模型生成文本是否带有翻译腔,并分析其与直接翻译产生的翻译腔的差异。

04:00
arXiv cs.CL

从实体提及到语气:基于LLM的媒体偏见分析流程

提出LLM媒体偏见分析流程:话题聚类、实体情感标注、来源比较,在阿尔巴尼亚新闻验证,适合资源有限场景。

04:00
arXiv cs.CL

答案格式变化对大型语言模型性别偏见的影响

研究不同答案格式对LLM性别偏见测量及人类分布对齐的影响,发现格式显著改变结果,建议多格式评估。

04:00
arXiv cs.CL

低资源语言中的思考:SFT之所建,RL之所修,准确率之所不见

SFT使低资源语言推理涌现,RL修复格式违抗,准确率基准因噪声失效。

04:00
arXiv cs.CL

使用多模态语言模型审计TikTok有害内容暴露:跨国、年龄分层研究

用多模态语言模型审计TikTok,关键词搜索使有害内容增1.5-7.5倍,意大利各年龄风险最高。

04:00
arXiv cs.CL

CoAL-RAG:一种复杂度感知的法律检索增强生成方法

提出复杂度感知法律RAG,基于问题本质与检索一致性自适应路由策略,显著提升中英文基准的生成质量与效率。

04:00
arXiv cs.CL

写、执行、精炼:从技能跟随者到技能优化者,通过执行反馈强化学习

WER框架用执行反馈训练技能优化器,超越无技能基线7.8分,优于同骨干9.35分。

04:00
arXiv cs.CL

PTXBench:面向GPU内核优化、利用架构特定PTX的LLM基准与适配

提出PTXBench基准,评估LLM生成架构特定PTX优化GPU内核;现有模型表现不均,适配训练部分有效但泛化不足。

04:00
arXiv cs.CL

ArborMem:以记忆森林导航交互状态

提出一种在线记忆框架用记忆森林导航交互状态保持多任务连续性在多个基准上超越强基线查询延迟低于半秒

04:00
arXiv cs.CL

从文本到多模态交互的多轮对话AI:数据、模型、评估与开放挑战

多轮对话AI从文本转向多模态,面临记忆、跨轮锚定、全双工、评估与文化对齐等挑战,亟待研究。

04:00
arXiv cs.CL

偏好非干预:读者特定证据效用的结构与稳定性边界

读者偏好排序稳定,但干预效果受任务限制;证据效用存在,偏好不能预测干预转移。

04:00
arXiv cs.CL

SpeechSense:面向细粒度语音情感分析的副语言聚焦数据集

提出SpeechSense数据集,定义8类韵律驱动的人际立场,实验证实声学模型优于文本基线。

04:00
arXiv cs.CL

BayesPrompt:生成有意义且人类可读的提示

将提示优化重构为贝叶斯后验推断,提出算法采样既高效又人类可读的提示,在真实数据集上优于现有方法。

04:00
arXiv cs.CL

已编码但不可操作:审计冻结大语言模型在几何约束中的解码-生成-操控差距

审计冻结大模型几何约束:可解码信息未必能生成或干预,解码、生成、激活影响与可控性可能背离。

04:00
arXiv cs.CL

大语言模型能否处理信念与事实取决于措辞方式

模型对错误信念的识别因措辞而异,源于事实核查干扰信念追踪。

04:00
arXiv cs.CL

从全球基准到本地评估:为德国公共部门评测大语言模型

德国公共部门大模型评测:聚焦能耗、透明度与政党立场,无模型全面占优,能耗差六十倍,选型须考虑治理。

04:00
arXiv cs.CL

TraceSQL:面向无参考文本到SQL验证的可追溯可回答性估计

提出TraceSQL轻量验证模型,用67个诊断特征估计SQL正确性,F1达66.47%,超基线,且决策可追溯。

04:00
arXiv cs.CL

BEAR-Bench:面向多模态模型的双语企业与学术推理基准

提出BEAR-Bench,含英俄双语千题,评测16个多模态模型,显示提升空间,并检验幻觉检测。

04:00
arXiv cs.CL

CABLE:基于互补前因的链接与扩展,延伸记忆检索的覆盖范围

CABLE构建与语义检索互补的稀疏前因链接,扩展记忆覆盖,在跨会话、多记忆场景下显著提升检索效果。

04:00
arXiv cs.CL

可解释的人类,异类大语言模型:评估应答中潜在结构的专家分析

专家可解释人类因素,却无法解释LLM在定量推理中的因素,仅能解释一半化学因素,表明LLM机制与人类推理不同。

04:00
arXiv cs.CL

ChatGPT基于推特情感分析预测股市趋势的潜力

研究显示,ChatGPT分析推特情感可正向预测微软和谷歌次日股价,凸显AI在金融预测中的价值。

04:00
arXiv cs.CL

评分需要评分标准,而非智能

小语言模型按明确评分量规给开放式答案评分,可媲美昂贵模型;分数差异几乎全由答卷决定,量规中的参考答案是关键。

04:00
arXiv cs.CL

IOL-AI挑战赛:推动语言推理的开放挑战

提出IOL-AI语言推理挑战赛,发现规模非关键,推理策略更重要;前沿模型获金牌,受限系统垫底,语言推理可作通用推理基准。

04:00
arXiv cs.CL

经验链:面向大语言模型的持续改进

提出经验链(CoE)方法,让LLM通过测试时迭代交互积累经验,自反馈即可提升性能,结合互补反馈更优,且降低成本。

04:00
arXiv cs.CL

语言具有两个参数:叙事诱导的语义可塑性与相位敏感解读

语言双参数:幅度与相位。相位是历史索引的有符号关系,决定意义组合,现有模型缺失。弱主张:理解需个体/二元组的相位。

04:00
arXiv cs.CL

判断、检索或弃权:具有可证明风险保证的不确定性防护型LLM评判

提出风险控制框架,校准不确定性阈值,保证接受评判的误发现率低于用户设定水平,并在低置信时路由至检索增强模式,提升覆盖率。

04:00
arXiv cs.CL

大语言模型是否玩六度分隔?长上下文流形中的拓扑压缩测量

大模型深层隐空间呈小世界网络,远距概念压缩至六跳内;事实生成约三跳,幻觉致拓扑崩溃,可检测幻觉。

04:00
arXiv cs.CL

多智能体AI系统用于放射报告结构化与质控,并经独立放射科医生评估

本地部署多智能体系统可结构化放射报告并检测质控问题,放射科评估显示性能良好,支持报告标准化与质控。

04:00
arXiv cs.CL

当写作风格漂移:体裁、时间与AI时代分布偏移下的作者身份验证基准测试

首个德语作者验证基准,15万文本对覆盖三类偏移;时间漂移影响最大,微调LLM最佳,未现AI时代偏移。

04:00
arXiv cs.CL

TokEval:分词器评估套件

提出TokEval分词器评估框架,涵盖信息论与结构敏感指标;实验表明前者预测语言建模,后者关联任务精度。

04:00
arXiv cs.CL

跨不可关联身份的解构攻击:LLM服务有状态防御的极限

不可链接身份下,解构攻击无法被有状态防御阻止;重试使防御失效,需额外身份绑定或控制答案使用。

04:00
arXiv cs.CL

聚合分数遗漏之处:商业LLM API迁移中的项目级回退测量

聚合分数掩盖迁移中条目级双向变化:改进与回退并存,严格与宽松评分结果差异显著。

04:00
arXiv cs.CL

SeqFeed:利用时序行为反馈改进智能体RTL代码生成

SeqFeed利用SeQuery查询波形和SeGraph追踪依赖,提供事件可寻址、依赖可追踪、可迭代查询的时序反馈,提升RTL生成通过率。

04:00
arXiv cs.CL

意图驱动的动态分块:面向预测信息需求的文档切分

提出意图驱动动态分块,用预测意图和动态规划切分文档,提升检索准确率,减少分块数。

04:00
arXiv cs.CL

个性化何时变偏见:AI生成金融建议中的结构性与话语性宗教框架

研究显示,AI理财建议在12-18%案例中保持中立,宗教配对常触发偏见性表述,构成个性化与中立性的管理困境。

04:00
arXiv cs.CL

死后隐私的政治

死后隐私在范围、理由及司法辖区间不一致,其张力构成政治;跨大西洋、欧洲与全球南方的差异影响记忆与尊严。

04:00
arXiv cs.CL

NeurIPS与ICML 2025立场论文轨道调查

2025NeurIPS/ICML立场轨道以改良性批判为主,缺方向引领性论文;应同时征集建构性工作。

04:00
arXiv cs.CL

Reflex-Guard:利用密集语义嵌入的低延迟LLM提示安全护栏

Reflex-Guard本地轻量护栏,37.6ms延迟,有害提示召回95.9%,优于基线。

04:00
arXiv cs.CL

J-Miner:从语言模型分类器中恢复可执行的决策知识

J-Miner从微调分类器中提取内部信号为可执行规则,高保真复现决策,并迁移至轻量模型。

04:00
arXiv cs.CL

面向按需合成库高效搜索的领域自适应分子语言模型

领域自适应微调可显著提升分子语言模型在目标库上的表征与采样效率,优于通用嵌入。

04:00
arXiv cs.CL

超越BFI:CSI提升大语言模型人格特质评估的信度与效度

针对大语言模型设计新型人格评估工具CSI,显著提升测量一致性与预测效度,实际行为相关性超0.85。

04:00
arXiv cs.CL

基于GRPO的大模型遗忘中奖励设定与基准可靠性的实证研究

针对目标邻近提示行为未定义,实验比较四种奖励设计,发现优化成功不等于行为遗忘,基准指标或分歧。

04:00
arXiv cs.CL

基于图结构在线难度估计的高效RLVR调度

提出图结构在线难度估计器,共享样本反馈,避免冷启动和过时,无需专用探测,提升强化学习调度性能。

04:00
arXiv cs.CL

反对政治极化:社交媒体上追踪演变政治意识形态的统一框架

提出TSN4PI框架,用大模型与时空图神经网络追踪社交平台政治意识形态演变,发布数据集,实证验证有效性。

04:00
arXiv cs.CL

人工评估中的真实性差距

人类评分是NLG评估金标准,但标准协议有缺陷,Likert量表可能扭曲真实偏好;新协议SPA可有效恢复GPT-3模型排序。

04:00
arXiv cs.CL

世界语语言频率与纠错分析

针对世界语等低资源语言,构建Eo-GP频率分析与Eo-GEC纠错数据集,利用GPT-3.5/4实验,GPT-4表现更优,可提升纠错策略。

04:00
arXiv cs.CL

理解词嵌入中的不良关联

证明子空间投影纠偏等价于无偏训练;WEAT高估偏差;RIPA显示SGNS不增加多数词性别关联,但放大刻板词。

04:00
arXiv cs.CL

MCTS-KBQA:基于信息增益奖励的蒙特卡洛树搜索用于知识库问答

提出快速蒙特卡洛树搜索,用信息增益奖励替代终端展开,免训练奖励模型,提升知识库问答的准确率与成本权衡。

04:00
arXiv cs.CL

Bactrainus:面向多跳复杂问答任务的大语言模型优化

Bactrainus框架全量上下文使F1降17-21分最优答案F1 89.01联合F1 79.70

04:00
arXiv cs.CL

类似N-gram的语言模型最能预测自然阅读时间

阅读时间由简单n-gram统计塑造,与n-gram概率最相关的神经语言模型,最能预测自然阅读时间。