悉数捕获:谄媚的多种模式
揭示谄媚并非单一行为,而是由多种表征和计算上不同的模式组成。
OpenSkillRisk:基于真实世界高风险第三方技能的智能体安全基准测试
构建263个风险技能的基准,测试发现智能体仍有17%执行危险动作,揭示三种典型风险处理失败模式。
可掩蔽性指数:预测预训练语言模型中的任务-目标对齐
提出可掩蔽性指数(MI),量化提示与预训练目标的对齐,在低资源下提升知识抽取性能。
背靠背与复制:AI生成的当代视觉艺术仿作的计算分析
新模型在语义和多样性上优于旧模型,但颜色纹理稍逊;风格评估多维且不依赖空间架构。
HalluTruthQA:面向阿拉伯语问答中幻觉检测、定位与解释的细粒度基准
HalluTruthQA是阿拉伯语问答幻觉细粒度基准,含2400例覆盖伊斯兰知识等四领域,评估显示幻觉评估需超越检测,走向定位、验证和解释。
语言实现选择对LLM立场的影响:因果追踪分析
语言构式选择系统性改变LLM立场,激活修补定位中晚期解码器层是关键恢复信号。
惊奇并非理论
惊奇理论并非免于表征决策,算法与架构显著影响语言模型概率,需重新评估LLM概率的互换性。
On the Systematic Challenges of Culturally Loaded Machine Translation: Dream of the Red Chamber as the Cultural Lens
暴露并非必需:语言模型中的非同类别并列学习
语言模型无需直接暴露即可习得非同类别并列,依赖组合能力与结构泛化。
SLAI T-Rex:在昇腾SuperPOD上对DeepSeek-V4系列进行全参数后训练
昇腾SuperPOD高效后训练万亿参数MoE,MFU达34.22%(提升2.93倍);OR专用模型零样本Pass@1达71.81%,超越GPT-5.4-Mini。
Spectral-LSH:通过Krylov投影局部敏感哈希实现次二次提示压缩
Spectral-LSH 是无训练提示压缩法,用 Krylov 子空间和随机特征近似注意力核,通过 SimHash 聚合 token,高压缩比下谱方法保留质量。
大型语言模型的可靠概率安全界限
利用潜在空间特征优先探索有害分支,计算LLM输出有害概率的严格下界,保证可靠性。
LLMs在哪些价值观上混淆?一项基于Schwartz理论的识别研究
LLM识别Schwartz价值观准确率仅68.3%,邻近价值错误占50.9%,存在八种非对称定向混淆,需结合准确率与错误分析评估。
PyroDash:成本高效的词元级小-大语言模型协作推理
PyroDash通过SLM控制词元决策,平衡准确率与成本,显著减少LLM调用。
生成式AI涌入并稀释了图书市场
AI生成书籍靠规模抢占市场,导致无AI书籍收入下降,重塑创意市场。
自我备忘:LLM能否从经验抽象中获益?
LLM通过提取和应用经验抽象(如策略、警示)提升数学逻辑推理,自我提取效果堪比教师提取,且框架可迁移。
LKValues:使大语言模型与斯里兰卡社会价值观对齐
提出斯里兰卡首个价值对齐资源套件LKValues,含40项价值观、15万指令及千条基准,微调改善低资源文化对齐差距。
大型语言模型中的信息辨别能力
LLMs在来源和事实辨别上近乎随机,依赖流行度而非可靠性,更新幅度与真实度无关。
AdaRoPE:不同注意力头应区别旋转与缩放
提出AdaRoPE,为每个注意力头学习独立旋转频率与缩放因子,优化长上下文性能与扩展能力。
基于统计的稀疏特征干预
提出基于统计的SAE特征干预法,六条件过滤与Borda共识排序构建无优化方向;实验显示效果高度局部化,需质量条件化评估。
通过表征对齐缓解苏格拉底式辅导中的脚手架坍塌
提出两阶段框架,结合偏好优化与表征损失,将坍塌率降至32%,延迟坍塌超九个回合,保持低过度拒绝。
HyGRL:面向多实体问题的自适应混合图推理
HyGRL将文本嵌入知识图谱形成异构网络,通过模仿学习和强化学习实现低成本、近实时的精准推理。
DocOps:面向复杂文档操作中自主智能体的可验证基准
DocOps可验证基准,评估自主智能体文档操作,揭示其在长程复杂任务中的状态跟踪崩溃、浅层语义验证及结构元数据破坏等关键失败模式。
JailMeter:一种基于证据的大型语言模型越狱攻击评估框架
提出JailMeter框架,基于信息瓶颈双反馈优化评估越狱攻击,准确率97.27%,并蒸馏出高效小模型。
BaseRT:借助苹果M5神经加速器推动顶尖大语言模型推理
BaseRT利用M5神经加速器,在Apple硬件上实现LLM推理吞吐量大幅提升,最高达llama.cpp的6.4倍。
审计基于检索增强的大语言模型在纵向细胞绘画形态学中的假设
提出检索增强LLM审计框架,定量验证假设,V1无无效引用,V2形态兼容性随扰动增强,生成可审计生物学假设。
以知识为中心的自我改进
通过知识库持久化改进替代智能体中心范式,提升解决率并降低成本,且知识可跨任务和模型迁移。
双生代理:面向特权分离代理的上下文残差压缩
双生代理通过残差压缩实现特权分离,在保证任务效用的同时防御提示注入攻击,性能优于基线。
奖励更优思考:面向LLM偏好对齐
提出思考清单奖励(TCR),通过EMA残差公式隔离补充思考,显著提升LLM偏好对齐性能。
ENTRAP-VL: 面向视觉-语言模型中双重语境诱发的分类学探针
提出ENTRAP-VL数据集,用于系统研究视觉-语言模型中的双重语境诱发现象,含1500项分类条目。
JANUS:预见长期代理安全的潜在风险
提出Janus框架,联合优化预测与裁决任务,训练Vanguard守卫模型,安全保护提升15.9%且任务完成率提高5.1%。
利用数据增强提升大语言模型从电子病历中识别和排序重要医学术语:一项比较研究
比较表明,微调和数据增强可提升LLM从电子病历提取医学术语的能力,效果取决于数据质量和匹配标准。
自监督比临床监督更能驱动医学基础模型的表征收敛
自监督目标驱动医学图像编码器表征收敛(40.4%),远超监督学习(21.1%),且不随规模增长,线性分类器跨编码器迁移保留约85%性能。
PoTRE:受认知异质性启发的测试时推理
PoTRE通过多代理异构推理与自适应聚合,在HLE上斩获49.92% SOTA准确率,效率超越同质基线。
维度之赐:高维空间中的近乎正交性如何解释时间可迁移性
PortLLM在持续预训练中表现出长期时间可迁移性,源于高维向量的近乎正交性。
视觉-语言模型中模态顺序一致性的测试时训练
发现VLM对模态顺序敏感,图像优先更优;测试时训练缩小差距并提升性能,修复中层网络错位。
训练模型,而非读者:面向可验证激活解释的可解码性监督
高重构不代表主张正确;RECAP通过可解码性监督实现内部内容独立验证,有效对抗虚假解释,AUC达0.95。
LaSEr-Edit:基于能量定位的局部跨度级错误编辑
提出LaSEr-Edit方法,利用轻量级能量模型进行错误定位,通过LLM编辑或候选重排序实现高效约束控制,性能优异。
读取与引导开放权重语言模型中材料科学机制的表示
研究发现,材料科学机制在语言模型中可通过状态读取、定向变换和因果控制表示,物理关系在状态变化中更为显著。
NeuroSymActive:面向知识图谱问答的可微分神经符号推理与主动探索
提出NeuroSymActive框架,结合可微分神经符号推理与主动探索,在KGQA上实现高精度并降低计算成本。
The Impact of Editorial Intervention on Detecting Native Language Traces
无需对齐数据的同步语音翻译
Hibiki-Zero模型无需词级对齐,基于句子级训练与GRPO强化学习优化延迟,实现同步语音翻译的SOTA性能。
设计性缺失:面向可撤销多模态情感分析的可证明模态删除
提出MBD框架,实现可撤销多模态情感分析,能在模态删除时保持性能并提供隐私-效用权衡。
内部知识无外显表达:探究古典中文语言模型的泛化边界
纯文言文模型内部能区分真假事件,但从不表达不确定性,元认知需额外训练。
EssayCBM:基于评分标准的概念瓶颈模型实现透明作文评分
EssayCBM将作文评分分解为8个可解释概念,实现透明可编辑的评分,性能匹配神经基线。
K12-KGraph:面向教育大语言模型评估与训练的课程对齐知识图谱
提出课程对齐知识图谱K12-KGraph及基准K12-Bench与训练集K12-Train,实验证明领域监督可提升模型性能。
基于量规的大语言模型评估中的自我偏好偏差
首证基于量规评估中的自我偏好偏差:客观标准下错误率超50%,主观场景偏差达10分,影响模型排名。
AugAbEx: 桥接抽象式与抽取式法律摘要生成
提出AugAbEx流水线,通过增强数据集引入银标准抽取摘要,提升法律摘要质量,在七个数据集上超越现有方法。
抽象促使语言模型和语音模型与大脑对齐
模型与大脑对齐源于共享意义抽象,中间层内蕴维度峰值预测脑信号,体现语义丰富性。
STEMTOX:从协作标签到细粒度有毒模因检测的熵引导多任务学习
提出TOXICTAGS数据集和STEMTOX框架,利用协作标签增强多模态毒性模因检测,显著提升性能。