9995 条条目 · 106 个活跃源
2026年8月3日
04:00
arXiv cs.CL

顺滑应对抵抗:偏好优化的LLM咨询师在动机性访谈中可权衡目标坚持与人际协调

惩罚对抗可降低目标坚持但人际协调提升因模型而异;惩罚屈服无效;仅提示词能提升协调而不损目标坚持。

04:00
arXiv cs.CL

金融大语言模型应用的系统级验证:基准测试不等于验证

金融大模型系统仅凭基准成绩不能上线,需跨数据、模型、检索、智能体、治理等全栈持续验证,而非一次性评分。

04:00
arXiv cs.CL

基准并非铁板一块:面向大语言模型评估的样本级审计与编排

提出数据集中心的元评估框架,对基准样本做五维审计,揭示异质性,支持按标准重组子集以定向评估模型。

04:00
arXiv cs.CL

TextCloak:通过强化学习驱动的不可学习文本,阻止未经授权的大语言模型利用

提出TextCloak框架,用强化学习生成不可学习文本,使未经授权的大模型微调失效,且保持文本可用。

04:00
arXiv cs.CL

从行间注到集注汇编:面向中国古典文本经注知识的情境保持型组织

提出自动编纂集注的NLP框架,保留注文语境依赖,聚类跨版本注释,F1超97%,支撑经注知识大规模组织。

04:00
arXiv cs.CL

M3-DuplexBench:面向全双工语音对话模型的多轮、多语言、多领域基准

提出M3-DuplexBench基准,涵盖英日双语和多领域,分析对话历史影响,揭示语言与领域性能差距。

04:00
arXiv cs.CL

与分词器无关的Engram模块

提出用多项式哈希替代异或哈希,使Engram嵌入与分词器解耦,性能相当。

04:00
arXiv cs.CL

欺骗的语义:法律欺骗检测与通用领域最优方法的基准测试

法律欺骗检测:微调模型通用领域更优,少样本大模型低资源法律场景有竞争力;需领域适应与可解释。

04:00
arXiv cs.CL

更快但不同:加速多模态扩散语言模型的内容漂移诊断与控制

无训练加速引发内容漂移;缩短KV缓存刷新间隔恢复一致性,实现1.3倍加速;仅为诊断控制,非精度保障。

04:00
arXiv cs.CL

BLADE:面向高效LLM推理的边界扩展与层自适应动态退出

提出BLADE框架,利用多粒度检查点与层自适应探测动态终止冗余推理,保持精度同时减少生成token 24.8%(8B)和15.8%(4B)。

04:00
arXiv cs.CL

零样本大语言模型能否预测儿童营养不良?一项公平性与时间鲁棒性研究

研究用GPT-4o-mini零样本预测儿童发育迟缓,性能与监督基线相当,敏感性更高,但城乡和家庭财富间存在公平性差异。

04:00
arXiv cs.CL

PARALLEL:一种前额叶对齐的强化启发式语言模型显式限度学习方法

提出PARALLEL方法,用强化启发控制器按样本分配更新强度,优先有益更新,限制无用参数改动,高效保留全适应性能,支持稳定流式适应。

04:00
arXiv cs.CL

FairFund-Bench:评估大语言模型资源分配中的分配偏差

新基准统一评估大模型资源分配,发现审计格式改变偏差方向,隐蔽审计放大偏差,因果框架影响远超人口特征。

04:00
arXiv cs.CL

混合翻译器:跨异构大语言模型的KV缓存翻译

提出MoT框架,以多翻译器及上下文校正损失,实现异构LLM间KV缓存复用,保持问答效果。

04:00
arXiv cs.CL

突厥语族机器翻译中的跨语言迁移

研究突厥语族五种语言对迁移,近亲语言间迁移最强,方向有影响,拉丁化部分提升性能。

04:00
arXiv cs.CL

端到端学习标量奖励模型的潜在推理轨迹

提出潜变量推理轨迹的标量奖励模型,端到端优化最大化下游奖励似然,优于三类基线。

04:00
arXiv cs.CL

转写德语视频的作者身份验证

德语视频转写作者验证:十种方法中传统n-gram最佳(88%准确率),优于Transformer。

04:00
arXiv cs.CL

Hy-MultiTurn:深度多轮对话理解的六维基准

提出中文深度多轮对话基准,六维评估,测试22个模型,最优GPT-5.5仅41.1%,挑战性强。

04:00
arXiv cs.CL

知道何时该放弃:诊断并训练大语言模型中止徒劳推理

提出CaRL方法,用奖励塑造和拒绝增强让LLM在超能力任务上减少徒劳推理,保持性能。

04:00
arXiv cs.CL

数据闸机:一个可扩展的开放框架,用于函数调用数据生成

开源框架生成高质量函数调用数据,显著提升小模型工具使用能力,缩小与大模型差距。

04:00
arXiv cs.CL

小即足够:通过LoRA适配器实现AI编辑文本的按用户风格改写

一种隐私优先系统,用LoRA微调小模型将AI编辑文本改写成用户风格,评分稳定在0.69,小模型即可。

04:00
arXiv cs.CL

思考式翻译:面向多领域机器翻译的难度自适应强化学习推理

提出TwT框架,经两阶段训练,以更少推理成本超越更大模型,实现多领域机器翻译的高质量与高效泛化。

04:00
arXiv cs.CL

中文标题:检测跨迁移路线的经验性互文性:超越法语叙事的表面相似性

中文摘要:提出经验性互文检测。无标注下零样本最佳,31特征混合模型相关性0.45,较最优单法提升21%。

04:00
arXiv cs.CL

CalibratedRubric:面向开放式大语言模型评估的任务自适应量规库

提出校准量规框架,采用贝叶斯可测性过滤与IRT选库,人机一致率显著提升,量规由131减至49。

04:00
arXiv cs.CL

Zero-Mem:LLM智能体的零令牌记忆操作

提出零令牌记忆操作,仅最终问答调用LLM,保留原始痕迹,双视图检索,性能相当且时间成本降57.6%

04:00
arXiv cs.CL

证据类型竞争:干预数据何时能教会语言模型因果方向?

干预数据并非总教会因果方向;模型do()响应符号复制自观测上下文,推理时证据类型决定开关,擦除观测证据可释放被抑制的因果能力。

04:00
arXiv cs.CL

频率结构化的意义空间中的语言组合性演化

迭代学习表明:高频意义可脱离语法,但频率若作用于局部单元,语言无法稳定传递。

04:00
arXiv cs.CL

PTP:基于前Token预测的LLM反演以实现近乎精确的提示重建

提出黑盒LLM反演方法,用目标模型合成数据训练逆模型,经前Token预测实现提示重建,优于现有方法。

04:00
arXiv cs.CL

谄媚行为削弱了合作性视觉-语言任务中的认知警觉性

模型在合作对话中常因谄媚忽视自身证据而附和对方,导致认知警觉失败;用反谄媚向量干预可减少此类错误,提升可靠性。

04:00
arXiv cs.CL

机器翻译高效推理部署中的量化权衡研究

量化与分块策略影响机器翻译部署,标准评估或失准;两类模型稳健性不同,权衡取决于格式与策略。

04:00
arXiv cs.CL

ARB:用于AI文本检测器评估的匹配作者-改写基准数据集

ARB基准揭示:常规基准高估检测器,对人类经AI改写文本检测率骤降,对AI改写AI文本影响小

04:00
arXiv cs.CL

ResKV:为固定预算KV缓存压缩重建被省略的注意力贡献

提出ResKV,将KV预算分为精确主缓存与残差缓存,重建被省略token的注意力贡献,显著提升长上下文压缩性能。

04:00
arXiv cs.CL

FriendBench:人类与多模态大语言模型二元熟悉度推断基准

用20秒对话片段推断两人是否相识,26模型对比人类,最佳模型准确率相当但倾向“陌生人”,公开数据。

04:00
arXiv cs.CL

知行合一:探究大语言模型个性化中的记忆利用

大模型个性化中模型常知而不行;配对测试16系统千项偏好显示知行差距大,记忆架构缓解有限,健康类尤弱。

04:00
arXiv cs.CL

GoldenRetriever:面向隐私保护RAG的非交互式同态加密检索

提出基于阈值选择的非交互式同态加密检索框架,复杂度由二次降为线性,实现隐私保护RAG。

04:00
arXiv cs.CL

引导还是不引导:在线讨论中人类与LLM的引导倾向

在线讨论中,人类与LLM的引导时机判断不同:人类谨慎,LLM急切,但都对无需引导更确定;分类器更可靠。

04:00
arXiv cs.CL

TokTier:面向智能体LLM服务的精确有状态分词

TokTier实现精确有状态分词,增量窗口修复+GPU加速,零偏差且比HF快数百倍,大幅降低首Token延迟。

04:00
arXiv cs.CL

WCM:面向视觉-语言-动作强化学习的世界评论家模型

提出世界评论家模型,联合预测未来潜状态与价值估计,解决VLA评论家时间动态缺失问题,149个任务及真实操作达最优。

04:00
arXiv cs.CL

RecHarness:基于强盗路由的自进化推荐系统智能体框架

提出强盗路由智能体框架:路由选方向,大模型生成假设,跳跃盆地机制突破停滞,稳定提升推荐优化效果。

04:00
arXiv cs.CL

使用扩展ICAP框架测量协作话语中的认知投入:比较人工标注、上下文学习与反思性LLM智能体

基于扩展ICAP框架比较人工与LLM标注,人工信度更高,框架细化提升有限,智能体方法有潜力。

04:00
arXiv cs.CL

TransMem:将隐藏状态转化为大语言模型的记忆

提出TransMem,将冻结大语言模型的稀疏历史隐藏状态转化为可复用记忆,经门控网络与自蒸馏,显著提升长上下文智能体性能。

04:00
arXiv cs.CL

TORUS:统一音频模型渲染-理解自洽性测试

首次提出音频统一模型自洽性测试,含432题,最佳模型正确率50.5%,低于级联基线的63.2%,自洽性亟待提升。

04:00
arXiv cs.CL

弥合检索增强生成中的问答差距:假设提示嵌入

提出HyPE方法,将假设内容生成移至索引阶段,在不增加延迟下提升检索精度与召回率。

04:00
arXiv cs.CL

语言模型彼此一致,而非与读者一致

基于真实读者标注,模型间一致性显著高于与读者间一致性,非伪影;小模型与人类相当,新模型依旧。

04:00
arXiv cs.CL

分离主题模型中的相似性与关联性

预训练语言模型增强的主题模型与LDA在语义结构上不同:沿主题关联性与分类相似性两轴衡量,二者对下游任务各有优劣,需兼顾诊断。

04:00
arXiv cs.CL

OPERA:用于高效检索模型适配的在线数据剪枝

提出在线数据剪枝框架OPERA,动态剪枝在减半训练时间的同时提升排序与检索性能。

04:00
arXiv cs.CL

知识恢复驱动的提示优化:释放大语言模型在开放域关系三元组抽取中的潜力

提出知识恢复驱动的提示优化框架,无需标注即可自适应优化提示,统一关系形式,提升三元组抽取性能。

04:00
arXiv cs.CL

FineInstructions:将合成指令扩展到预训练规模

将互联网预训练文档转为数十亿合成指令-响应对,用1800万真实查询模板,仅以指令微调目标预训练,效果更优。

04:00
arXiv cs.CL

大语言模型能否发现新知识?一个动态生物学知识发现基准

现有基准受数据污染困扰,DBench-Bio动态自动评估AI生物学新知识发现能力,揭示当前模型局限。

04:00
arXiv cs.CL

叙事生成中分布外去偏的预条件测试时自适应

CAP-TTA仅在偏差风险高时触发LoRA更新,用预条件器快速优化降低毒性偏差,防遗忘、提升流畅性。