From Agent Failures to Text Policies: What Works and What Breaks
人格的几何学:基于荣格认知功能的激活引导
本文用荣格认知功能替代大五人格,实现LLM人格的单调控制,发现其几何结构与多维控制特性。
Rushes:用于多元对齐的人类偏好数据集
Rushes数据集显示,先进LLM预测用户选择不及流行度基线,揭示单一人口目标无法捕捉个性化偏好。
REGARD:大型语言模型中的区域情感差异
REGARD用VAD分析发现,LLM情感框架差异中通用回答率与低唤醒度强相关,聚类不受模型来源影响。
REFACT: 自适应事实复述以实现紧凑且忠实的链式思维推理
REFACT通过自适应事实复述与两阶段训练,提升长上下文问答忠实性并减少令牌消耗。
多样性指标是否衡量多样性?对LLM集成中多数投票增益的能力控制审计
多样性指标实际反映能力而非多样性;多数投票增益有限;能力控制后仅共享错误与增益负相关。
CSPF:面向不可验证偏好评估的约束共享-私有融合方法
CSPF将冻结奖励模型隐藏状态分解为共享与专家私有表示,实现互补融合,在不可验证偏好评估中取得最优性能。
大型语言模型中生命性概念的所在:追踪生命性概念的电路
发现LLM中存在处理生命性概念的因果电路,但分布广泛且仅部分泛化,体现其上下文依赖与分级性。
LegalCiteTrust:中文长篇法律研究报告中引文可信度的基准测试
提出LegalCiteTrust基准,从存在性、忠实性、适用性评估引文可信度,发现引文感知的证据治理可更有效提升信任得分。
腾讯WorkBuddy Bench:一种抗污染任务构建的多领域编码智能体基准
多领域编码智能体基准,反向工程真实提交构建抗污染任务,四子集覆盖代码、网页、办公、安全,开源可复现。
从词级词典到句子级语义:基于上下文模型的多语言 grievance 标注
用上下文模型替代词典,通过读全文提升 grievance 标注精度,避免了循环验证问题。
slang.gr:大规模众包非标准希腊语资源
首次大规模研究众包希腊俚语资源,构建结构化分类法分析其语言及社区特征,并提出置信度评分。
news-crawler-LM:一种用于高质量新闻爬取的小型长上下文模型
提出微调的小型长上下文语言模型,将HTML转为纯文本和JSON,在Markdown/JSON任务上优于基线,纯文本任务仅略优。
多问一句,少些遗憾:基于遗憾的LLM澄清策略多轮基准
提出RegretBench,用遗憾目标评估LLM多轮澄清策略,揭示高效澄清需适时提问并停止。
嵌入与LLM在希腊图书出版商场景中的比较评估——CUP数据集
提出CUP希腊图书检索基准,评估多种方法:多语言嵌入优于希腊专用模型,混合检索综合最优。
渐进式压缩:可靠的令牌压缩及其启示
渐进式压缩表明,完美重建依赖于脆弱引导而非可转移语义,不足以实现有意义压缩。
一个统一的用于指令微调的道德价值数据集
构建统一道德价值数据集用于指令微调,混合训练保留通用性能,初步观察混合比例对价值任务的影响。
CultureTalk-ID:印尼地方语言文化常识的多任务对话基准
首个基于对话的印尼多语言文化常识基准,含三个任务测试LLM文化理解与生成。
从智能体经验中高效样本学习
提出Experience Distillation,无需额外交互即可保留上下文学习64.8%增益,样本效率比强化学习高9.6倍。
QuantiBias:大语言模型中量化诱导偏见的基准测试
量化模型通过所有标准安全检测,但约四分之一开放回答仍含刻板印象,新基准需重新评估开放偏见。
PrefReward:学习用户偏好矩阵以实现个性化文本生成
PrefReward通过偏好矩阵和KL散度奖励显式建模用户风格,显著提升生成质量与可解释性。
自适应深度稀疏框架:基于相似性的预训练大语言模型资源分配
AdaDSF通过层间相似性动态分配token,实现预训练LLM深度稀疏化,推理加速且性能损失小。
当冷知识不再琐碎:多语言大模型在日常知识上的失误
多语言大模型在历史、地理等知识领域表现强,但流行文化(名人、音乐、电影)薄弱,且知识获取因语言而异。
GRADRAG:面向协调多智能体RAG的跨组件提示自适应
GRADRAG将RAG建模为计算图,通过评估反馈迭代更新上游智能体,两轮内实现12-15%净偏好提升。
低资源语言变体的音段强制对齐:成都话模型训练与评估
针对成都话训练文本依赖与文本独立对齐器,边界差异分别降低31.8%和61.2%,为低资源变体提供高效引导。
词义共同决定元音固有频谱变化:基于语料库的对话式普通话研究
基于对话普通话语料,发现词义共同决定元音频谱变化,词嵌入可高精度预测共振峰轨迹,挑战模块化语音产出模型。
资本市场LLM可靠性评分(CM-LRS):从“说得过去”到“值得信赖”
提出CM-LRS评分,从7维度评估资本市场LLM输出,发现闭源模型评分接近(4.30-4.31),开放权重模型落后(3.15),差距主要在检索和综合。
MemTools:面向可互操作智能体记忆的统一研究框架
MemTools通过标准化记忆生命周期与统一接口解耦组件,支持异构记忆协调,便于系统隔离分析。
反周期位置编码:莫比乌斯边界条件使上下文检索可靠
提出莫比乌斯RoPE,利用反周期边界条件,在保持困惑度的同时显著提升长上下文检索可靠性。
一个由受控扰动验证的结构化音频字幕评估框架
提出多轴评估框架,结合LLM与计算指标,经受控扰动验证,可区分语义保留与真实破坏。
思维链模型中令牌预算饱和与推理非收敛的机制性早期检测
思维链模型推理非收敛可在早期(token 150)通过中间表示部分检测,AUC 0.608,信号较弱。
DONDO:面向非洲语言的开源w2v-BERT语音识别基础模型
DONDO是基于w2v-BERT的开放ASR模型,含21个单语与5个多语模型,覆盖27种非洲语言变体,通过退火微调达10-13%词错误率。
RUMBA:俄罗斯用户记忆基准
RUMBA是评估大语言模型长时记忆的基准,包含俄英双语言,细粒度分类和时间推理,可诊断模型记忆机制优缺点。
任务、语言与模型在代码模型表示中的角色解构:What、Where与How
任务决定概念电路的有无,模型决定电路位置与增长方式;通用性取决于内容而非结构。
惊奇理论是赘述的(缺乏理性基础)
无约束时惊奇理论是赘述,需理性基础才能做出可证伪预测。
MedGame:大型语言模型驱动的故事化游戏化医学教育
MedGame框架用大模型将临床案例转为故事游戏,提升互动性,微调后效果接近商业模型。
演示GenDB:通过LLM智能体实现实例优化与定制化查询处理代码生成
GenDB利用LLM智能体生成实例优化的查询代码,提升性能,支持重复模板查询和混合架构。
化学链式思维:一种易产生幻觉的分子草稿本
化学CoT并非忠实推理,而是易生幻觉的分子草稿,正确答案常与虚构结构共存,需过程级监督。
人工自我纠正修辞:大型语言模型为何过度使用这一古典修辞手法及缓解方法
大模型过度使用“自我纠正”修辞,源于训练数据和RLHF。提出Epanorthosis指数,发现演讲中过度、问答中不足。LoRA适配器可按体裁校准至人类水平,目标非消除而是校准。
基于Transformer辅助的大语言模型源代码摘要方法:促进更安全的软件开发
通过Transformer辅助提示工程,提升LLM生成源代码摘要的质量,BLEU-4提高7.8%。
HiMe:用于可穿戴设备健康洞察的实时自托管个人代理平台
HiMe是本地部署的隐私优先代理平台,实时处理多设备健康数据,联合优化效果与效率,实现持续个性化监测。
VibeVoice-ASR-BitNet 技术报告
VibeVoice-ASR压缩版,采用INT8与三元权重异构量化,边缘CPU实时识别,RTF<1,速度比Whisper.cpp快1.6-2.3倍。
OpenForgeRL:在任何环境中训练原生于推理框架的智能体
开源框架OpenForgeRL实现跨环境端到端训练基于推理框架的智能体,性能大幅超越基线。
AI助手的过度干预
研究显示AI教师比人类更频繁、更早干预,常提供完整解答而非提示,优化短期成功而非深度学习。
Euclid-MCP:一个通过Prolog实现确定性逻辑推理的模型上下文协议服务器
Euclid-MCP开源服务器通过Prolog实现确定性推理,解决大模型在复杂逻辑中的幻觉,保证精确低延迟。
通过随机化设计实现KV缓存淘汰的错误证书
随机化KV缓存淘汰以泊松采样生成误差证书(覆盖率0.97),实现归因而非预测。
GS-Agent:利用生成式模拟创造4D物理世界
GS-Agent多智能体框架通过物理引擎,从自然语言自动生成动态、可控的4D物理世界,实现虚实交互与影视级控制。
无云环境的自主编码:评估开放权重大语言模型在纵向数据准备任务中的表现
评估开放权重LLM在纵向数据准备任务,31-35B模型完成率高达87.9%,验证无云环境下AI辅助数据准备的可行性。
窗口化多标记预测:消除百万词元上下文中的全上下文草稿KV开销
窗口化MTP通过滑动窗口限制草稿KV工作集,消除全上下文读取开销,百万词元下提速28%-44%,无需训练且无损。