On-Policy Distillation for Vision-Language Model Adaptation, an Effective Paradigm on Low-Quality Multimodal Data
KVShareArena:跨上下文与模型检查点的 KV 缓存复用
KVShareArena评测跨上下文与模型检查点的缓存复用:仅校正位置不够,多源场景需重编码或训练。
RiLM:基于测地解码的参数高效语言建模
RiLM 用流形测地距离解码取代输出矩阵,双曲版在 WikiText-2 上困惑度 54.2,约为最强基线的一半。
Rosetta 在 AlexandriaX-2026:LoRA 适配的 NileChat 用于上下文感知的方言阿拉伯语对话翻译
Rosetta用LoRA微调NileChat-3B,结合方言与对话上下文翻译,外部预训练带来负迁移。
中文标题:面向说话人稳定的低资源希腊语TTS的确定性提示方法
用WhisperX整理有声书数据并微调Parler-TTS,以确定性提示消除说话人漂移,3.5小时LoRA锚定音色,WER 10.7%。
IBIB:一种按服务路由而非模型标识符评测企业AI系统的协议
企业AI应按服务路由而非模型标识评测;IB2协议用预检、可靠性评分与盲审揭示可用性、区分度及路由效应
少即个性化:为个性化语言模型学习最小充分用户画像
ENOUGH动态构建最小充分用户画像,兼顾个性化效用与上下文成本,六项任务效果与效率均领先。
语音基础模型真的学会单词了吗?
残差化剔除音素信息后,HuBERT与wav2vec 2.0后层仍能独立编码单词,有助于词发现。
构建多语言桥梁:数据混合——语言内推理泛化的支柱
优化SFT数据配比,使3.35B模型在60种语言上母语推理率超93%,证明推理可跨语言迁移。
面向推荐系统的高效且有效的智能体群组托攻击
提出智能体群组攻击系统AGAS,由协调者指挥多角色智能体自适应推广目标商品,效果与效率均超越基线。
他们彼此是谁?面向说话人关系推断的多智能体推理
提出免训练多智能体推理框架,经多角色辩论与竞争裁决推断说话人关系,多数场景优于基线。
IdeaAMBIG:基准测试研究构想规范中影响实现的关键缺口
基准含660个研究构想规格缺口,评估缺陷定位与澄清;定位是瓶颈,补全可使实现就绪率14%→98%。
MMLU究竟测什么?对聚合基准分数中难度结构的心理测量学审计
MMLU总分主要测事实检索而非推理,混淆能力,偏向非STEM,推理选型错失约22%合适模型。
前沿规模下的安全对齐有多脆弱?针对320B MoE的单方向攻击
单方向攻击320B MoE,74%效果需联合编辑三类模块;七项有害基准降41-89个百分点,能力不变。
LiteRAG:成本高效的基于图的检索增强生成
以查询条件算法探索替代检索时LLM控制,构建推理链上下文,质量领先且延迟降百倍、成本降99%、省token 14倍。
BTBR:贝叶斯理论驱动的概率模糊框架,用于大语言模型隐性偏见去除
提出BTBR概率-模糊框架,通过似然比筛选与模型编辑去除大语言模型隐性偏见,兼顾通用推理。
没坏就别修:论大语言模型迭代式缺陷修复的动态
LLM 会误判无缺陷代码并反复改动,形成伪修复循环,源于内部缺陷代码表征被误激活。
MADS:面向多样化说服数据生成的多智能体对话模拟
提出多智能体对话模拟框架MADS,智能体自博弈生成说服性对话,免标注低成本,营销转化率提升22.4%。
NOPE-HYPE:面向多样声学环境中鲁棒语音转文本的结构化仿真工作流
提出NOPE-HYPE工作流:可控仿真器、PSD模板覆盖最优缩减与超参搜索,仿真噪声媲美真实噪声。
重新审视 Transformer 语言模型的形状约定
沙漏型Transformer以瓶颈MLP替代常规FFN,提升训练效率并降低长上下文解码与缓存开销。
大型语言模型何时表现出非诱导性欺骗?
评估18个LLM发现:所有模型在某些情境下会自发歪曲行动,欺骗有利时更常见,推理越强发生率越高。
从表征到生成:翻译心智的ABC框架
基于延展心智与激进生成论,提出ABC框架:翻译为情感—行为—认知动态生成活动,意义在具身互动中共创。
从评分标准到可靠评分:基于证据的大语言模型文本评判
提出 Rulers,固定评分标准,以证据化大模型评判并校准分数,提升与人评一致性和稳定性。
利用大语言模型改造代码以支持异常行为
提出代码异常补全新任务,设计融合静态动态分析与大模型EXCODER,Java基准通过率85.92%优于基线。
英国多语言英语使用者的AI语音认知筛查中的假阳性偏差
英国多语言者语音筛查中ASR无组间差异,但下游模型假阳性率达28–37%,约为单语者2.5倍。
ActTraitBench:通过基于人类的行为验证量化大语言模型中的知识—决策差距
提出ActTraitBench,基于人类数据量化大模型人格的知识-决策差距,并用CoCA干预缩小该差距。
意义的动态:面向僧伽罗语历时语义变化的评估
研究僧伽罗语13—20世纪语义演变,结合嵌入对齐与大模型剪枝,发现语义漂移不均,主要由少量高影响语境驱动。
心智在哪里?人格向量与大语言模型的个体化
从机制可解释性探讨LLM个体化,提出三种候选观,论证虚拟实例观并评估两种人格观。
左分支 Transformer 在右分支语言中表现出色:数据塑造语言模型的语序偏好
模型对人工语言偏左分支,自然语言数据增多后偏好SVO;语序偏好由数据驱动,或降低多样性。
多层级叙事评估在心理健康预测中优于词汇特征
830篇中文治疗文本显示,宏观LLM叙事评估对心理健康预测显著优于词汇特征,叙事结构具预测信号。
MultiSynt/MT:跨36种语言翻译的万亿词元多平行预训练数据
发布覆盖36种语言、约4.8万亿词元的合成平行预训练语料,显著提升多语言大模型并揭示评估盲点。
AtlasNLP:NLP 数据集国家代表性的国别感知图谱
AtlasNLP 是超1.3万条NLP数据集的国家感知图谱,揭示国家/任务覆盖不均、生产与代表性不对称、语言覆盖≠地理代表性。
评判回路解释 LLM 作为评判者时由格式引发的不一致性
因果分析表明,LLM评判依赖中后层MLP共享评估子图;判断经脆弱格式分支输出,故格式诱导不一致。
逐词阅读法律问题:2,144 条越南法律标题的嵌入轨迹
逐词编码2144条越南法律标题,发现金标文章常在6-7个实词后锁定,数字日期影响大,呈六类嵌入轨迹。
LLM-Generated or Human-Written? Comparing Review and Non-Review Papers on ArXiv
Elsewise: Authoring Open-ended Interactive Narrative with Possibility Space Visualization
Bringing Value Models Back: Generative Critics for Value Modeling in LLM Reinforcement Learning
Why Do LLM Agents Fail in Exploring New Environments? A World-Modeling Perspective
EviMem: Evidence-Gap-Driven Iterative Retrieval for Long-Term Conversational Memory
Preserving Long-Tailed Expert Information in Mixture-of-Experts Tuning
"What Are You Really Trying to Do?": Co-Creating Life Goals from Everyday Computer Use
EVA-Bench: A New End-to-end Framework for Evaluating Voice Agents
From Scores to Evidence: Auditable Decisions Can Improve Speech Deepfake Detection
HoneyRoute: Honeypot-Model Routing for Adversarial LLM Serving
Copying explains the collective behavior of AI agents in the wild
评分准则引导的大语言模型用于阿片类药物使用障碍可计算表型识别
开发评分准则引导的LLM识别OUD,253例中F1达0.774、AUROC0.934,优于机器学习及零样本LLM,具可解释性。
召回率不是保护:对照模型遵从性评估安全监控器
安全监控器对可诱发模型遵从的有害提示召回率显著更低,漏报提示更易被遵从;标准召回率高估实际保护效果。
MedWER:一种可复现、无模型的医学语音识别评估协议
MedWER以固定医学术语表替代NER模型,避免临床错误被词错误率掩盖,实现可复现医学语音识别评估并报告置信区间。
中文标题:危机话语中方面级情感与情绪分析的五阶段知识蒸馏框架CrisisKD
中文摘要:提出 CrisisKD 五阶段师生蒸馏框架,用大模型标注指导小模型完成危机文本方面级情感分析,提升精度并降低推理成本。
面向共同上下文问答的提示内并行解码
提出IPPD,在单提示内并行回答共同上下文问题,共享注意力计算,无需微调,吞吐量提升7倍且质量无损。