9796 条条目 · 106 个活跃源
2026年9月10日
04:00
arXiv cs.CL

On-Policy Distillation for Vision-Language Model Adaptation, an Effective Paradigm on Low-Quality Multimodal Data

04:00
arXiv cs.CL

KVShareArena:跨上下文与模型检查点的 KV 缓存复用

KVShareArena评测跨上下文与模型检查点的缓存复用:仅校正位置不够,多源场景需重编码或训练。

04:00
arXiv cs.CL

RiLM:基于测地解码的参数高效语言建模

RiLM 用流形测地距离解码取代输出矩阵,双曲版在 WikiText-2 上困惑度 54.2,约为最强基线的一半。

04:00
arXiv cs.CL

Rosetta 在 AlexandriaX-2026:LoRA 适配的 NileChat 用于上下文感知的方言阿拉伯语对话翻译

Rosetta用LoRA微调NileChat-3B,结合方言与对话上下文翻译,外部预训练带来负迁移。

04:00
arXiv cs.CL

中文标题:面向说话人稳定的低资源希腊语TTS的确定性提示方法

用WhisperX整理有声书数据并微调Parler-TTS,以确定性提示消除说话人漂移,3.5小时LoRA锚定音色,WER 10.7%。

04:00
arXiv cs.CL

IBIB:一种按服务路由而非模型标识符评测企业AI系统的协议

企业AI应按服务路由而非模型标识评测;IB2协议用预检、可靠性评分与盲审揭示可用性、区分度及路由效应

04:00
arXiv cs.CL

少即个性化:为个性化语言模型学习最小充分用户画像

ENOUGH动态构建最小充分用户画像,兼顾个性化效用与上下文成本,六项任务效果与效率均领先。

04:00
arXiv cs.CL

语音基础模型真的学会单词了吗?

残差化剔除音素信息后,HuBERT与wav2vec 2.0后层仍能独立编码单词,有助于词发现。

04:00
arXiv cs.CL

构建多语言桥梁:数据混合——语言内推理泛化的支柱

优化SFT数据配比,使3.35B模型在60种语言上母语推理率超93%,证明推理可跨语言迁移。

04:00
arXiv cs.CL

面向推荐系统的高效且有效的智能体群组托攻击

提出智能体群组攻击系统AGAS,由协调者指挥多角色智能体自适应推广目标商品,效果与效率均超越基线。

04:00
arXiv cs.CL

他们彼此是谁?面向说话人关系推断的多智能体推理

提出免训练多智能体推理框架,经多角色辩论与竞争裁决推断说话人关系,多数场景优于基线。

04:00
arXiv cs.CL

IdeaAMBIG:基准测试研究构想规范中影响实现的关键缺口

基准含660个研究构想规格缺口,评估缺陷定位与澄清;定位是瓶颈,补全可使实现就绪率14%→98%。

04:00
arXiv cs.CL

MMLU究竟测什么?对聚合基准分数中难度结构的心理测量学审计

MMLU总分主要测事实检索而非推理,混淆能力,偏向非STEM,推理选型错失约22%合适模型。

04:00
arXiv cs.CL

前沿规模下的安全对齐有多脆弱?针对320B MoE的单方向攻击

单方向攻击320B MoE,74%效果需联合编辑三类模块;七项有害基准降41-89个百分点,能力不变。

04:00
arXiv cs.CL

LiteRAG:成本高效的基于图的检索增强生成

以查询条件算法探索替代检索时LLM控制,构建推理链上下文,质量领先且延迟降百倍、成本降99%、省token 14倍。

04:00
arXiv cs.CL

BTBR:贝叶斯理论驱动的概率模糊框架,用于大语言模型隐性偏见去除

提出BTBR概率-模糊框架,通过似然比筛选与模型编辑去除大语言模型隐性偏见,兼顾通用推理。

04:00
arXiv cs.CL

没坏就别修:论大语言模型迭代式缺陷修复的动态

LLM 会误判无缺陷代码并反复改动,形成伪修复循环,源于内部缺陷代码表征被误激活。

04:00
arXiv cs.CL

MADS:面向多样化说服数据生成的多智能体对话模拟

提出多智能体对话模拟框架MADS,智能体自博弈生成说服性对话,免标注低成本,营销转化率提升22.4%。

04:00
arXiv cs.CL

NOPE-HYPE:面向多样声学环境中鲁棒语音转文本的结构化仿真工作流

提出NOPE-HYPE工作流:可控仿真器、PSD模板覆盖最优缩减与超参搜索,仿真噪声媲美真实噪声。

04:00
arXiv cs.CL

重新审视 Transformer 语言模型的形状约定

沙漏型Transformer以瓶颈MLP替代常规FFN,提升训练效率并降低长上下文解码与缓存开销。

04:00
arXiv cs.CL

大型语言模型何时表现出非诱导性欺骗?

评估18个LLM发现:所有模型在某些情境下会自发歪曲行动,欺骗有利时更常见,推理越强发生率越高。

04:00
arXiv cs.CL

从表征到生成:翻译心智的ABC框架

基于延展心智与激进生成论,提出ABC框架:翻译为情感—行为—认知动态生成活动,意义在具身互动中共创。

04:00
arXiv cs.CL

从评分标准到可靠评分:基于证据的大语言模型文本评判

提出 Rulers,固定评分标准,以证据化大模型评判并校准分数,提升与人评一致性和稳定性。

04:00
arXiv cs.CL

利用大语言模型改造代码以支持异常行为

提出代码异常补全新任务,设计融合静态动态分析与大模型EXCODER,Java基准通过率85.92%优于基线。

04:00
arXiv cs.CL

英国多语言英语使用者的AI语音认知筛查中的假阳性偏差

英国多语言者语音筛查中ASR无组间差异,但下游模型假阳性率达28–37%,约为单语者2.5倍。

04:00
arXiv cs.CL

ActTraitBench:通过基于人类的行为验证量化大语言模型中的知识—决策差距

提出ActTraitBench,基于人类数据量化大模型人格的知识-决策差距,并用CoCA干预缩小该差距。

04:00
arXiv cs.CL

意义的动态:面向僧伽罗语历时语义变化的评估

研究僧伽罗语13—20世纪语义演变,结合嵌入对齐与大模型剪枝,发现语义漂移不均,主要由少量高影响语境驱动。

04:00
arXiv cs.CL

心智在哪里?人格向量与大语言模型的个体化

从机制可解释性探讨LLM个体化,提出三种候选观,论证虚拟实例观并评估两种人格观。

04:00
arXiv cs.CL

左分支 Transformer 在右分支语言中表现出色:数据塑造语言模型的语序偏好

模型对人工语言偏左分支,自然语言数据增多后偏好SVO;语序偏好由数据驱动,或降低多样性。

04:00
arXiv cs.CL

多层级叙事评估在心理健康预测中优于词汇特征

830篇中文治疗文本显示,宏观LLM叙事评估对心理健康预测显著优于词汇特征,叙事结构具预测信号。

04:00
arXiv cs.CL

MultiSynt/MT:跨36种语言翻译的万亿词元多平行预训练数据

发布覆盖36种语言、约4.8万亿词元的合成平行预训练语料,显著提升多语言大模型并揭示评估盲点。

04:00
arXiv cs.CL

AtlasNLP:NLP 数据集国家代表性的国别感知图谱

AtlasNLP 是超1.3万条NLP数据集的国家感知图谱,揭示国家/任务覆盖不均、生产与代表性不对称、语言覆盖≠地理代表性。

04:00
arXiv cs.CL

评判回路解释 LLM 作为评判者时由格式引发的不一致性

因果分析表明,LLM评判依赖中后层MLP共享评估子图;判断经脆弱格式分支输出,故格式诱导不一致。

04:00
arXiv cs.CL

逐词阅读法律问题:2,144 条越南法律标题的嵌入轨迹

逐词编码2144条越南法律标题,发现金标文章常在6-7个实词后锁定,数字日期影响大,呈六类嵌入轨迹。

04:00
arXiv cs.CL

LLM-Generated or Human-Written? Comparing Review and Non-Review Papers on ArXiv

04:00
arXiv cs.CL

Elsewise: Authoring Open-ended Interactive Narrative with Possibility Space Visualization

04:00
arXiv cs.CL

Bringing Value Models Back: Generative Critics for Value Modeling in LLM Reinforcement Learning

04:00
arXiv cs.CL

Why Do LLM Agents Fail in Exploring New Environments? A World-Modeling Perspective

04:00
arXiv cs.CL

EviMem: Evidence-Gap-Driven Iterative Retrieval for Long-Term Conversational Memory

04:00
arXiv cs.CL

Preserving Long-Tailed Expert Information in Mixture-of-Experts Tuning

04:00
arXiv cs.CL

"What Are You Really Trying to Do?": Co-Creating Life Goals from Everyday Computer Use

04:00
arXiv cs.CL

EVA-Bench: A New End-to-end Framework for Evaluating Voice Agents

04:00
arXiv cs.CL

From Scores to Evidence: Auditable Decisions Can Improve Speech Deepfake Detection

04:00
arXiv cs.CL

HoneyRoute: Honeypot-Model Routing for Adversarial LLM Serving

04:00
arXiv cs.CL

Copying explains the collective behavior of AI agents in the wild