多智能体大语言模型校准的反事实图
CAGE-CAL通过对比通信与无通信的反事实图,校准置信度,提升可靠性辨别和拓扑选择。
ElasticMem:潜记忆作为LLM智能体的可学习资源
ElasticMem将记忆作为弹性潜资源,自适应检索并分配可变预算,显著提升QA准确率和具身控制成功率,降低token成本。
错误架构:从普遍不可能性到局部修补的LLM可靠性
无限域上LLM可靠性不可实现,但操作有界补丁内失败稀疏重复,可靠性转化为局部目录发现与干预覆盖。
语义运动锚点:在共语手势中连接运动与意义
提出语义运动锚点方法,将手势离散化并语言化,通过文本监督提升检索性能,用户更偏好其生成的语义丰富手势。
CobSeg:用于对话主题分割的连贯边界建模
CobSeg多分支架构分离语义连贯与词法边界,经边界预测与加权提升主题分割,五个基准上超越非LLM方法。
EUDAIMONIA:评估AI中的不良动态
提出社交AI设计准则与EUDAIMONIA基准,评估LLM社交危害,最强模型违规率超27%,揭示持续对齐问题。
COFT:面向大语言模型公平思维链推理的反事实-共形解码方法
无需训练,通过反事实提示与共形校准实现解码时公平控制,减少偏见30-55%,保持推理质量且计算开销小。
TeachObs:人工验证的多模态教学观察与模型评估基准
提出课堂视频多模态基准,含专家标注,评估大模型发现其表现不一且对清晰课程评价偏高。
同一患者,不同措辞,不同诊断?评估临床大语言模型的语义稳定性
提出NLI语义验证框架及三项指标,评估16个LLM,发现领域专业化与鲁棒性关系复杂,通用基线亦具竞争力。
大型语言模型不确定性中的人类对齐、校准与激活模式
探究大模型不确定性与人类相似性,分析校准、对齐及指令微调影响。
ExpGraph: 面向LLM智能体的模型无关经验学习与图结构记忆
ExpGraph通过图结构记忆和效用感知检索,实现模型无关的经验重用,显著提升LLM智能体性能并减少交互步数。
语言模型中针对性别化与性别中立即生成的神经元层面干预
提出神经元层面干预方法,识别并操控三类性别神经元,实现精准性别形式控制,发现神经元集中于模型早期层。
将LLM性别偏见锚定在人类基线上:一项跨语言审计
跨语言审计显示LLM性别偏见幅度约为人类跨国范围的2.5倍,且跨语言效应叠加;引入四模式框架,指出单一去偏方法无法均匀适用。
成对参考对齐作为模型级序数可观测变量
定义成对参考对齐为模型评分诱导的序数可观测变量,给出统计量及估计,在Qwen2.5和RewardBench上验证其随模型规模增长。
基于时空并行解码与置信度外推的高效扩散大语言模型
通过轨迹感知动态控制,减少冗余去噪迭代,结合置信度外推提前预测,加速推理并保持质量。
技能并非一刀切:面向LLM智能体的模型感知技能对齐
提出MASA框架,针对不同模型自适应调整技能,通过分层进化与轻量重写器提升性能,最高领先基线25.8分。
MosaicLeaks:深度研究代理开放查询的隐私风险
提出MosaicLeaks基准,评估代理外部查询泄露隐私,PA-DR框架将泄露率从34%降至9.9%。
XLGoBench:利用算法任务检测跨语言技能差距
用合成算法任务检测大模型跨语言能力差距,基准可比较、可扩展、可量化且透明,实验揭示持续差距。
Eywa: Provenance-Grounded Long-Term Memory for AI Agents
SAGE:面向智能体大语言模型高效记忆演化的新颖性门控
SAGE通过新颖性检测门控,高效管理智能体记忆,降低写入成本,提升质量与效率。
超越一致性:对面板浮现的生物医学实体候选进行评分以供审稿人分流
多LLM一致非正确,BioConCal评分器提升候选筛选效率,重塑噪声道为高产队列。
有毒幻觉:扰动提示与追踪LLM电路
有毒语言扰动会降低LLM事实准确性,归因图揭示内部机制变化。
增量式BPE分词
提出增量BPE分词算法,每字节最坏O(log²t)时间,整体复杂度O(n log²t),支持流式,速度提升约3倍。
MADS:面向指令微调的模型感知多样化核心集选择
基于模型推理时神经激活状态选核心集,15%数据微调平均提升2.5%。
你的老师在这里帮不了你:对抗在线策略蒸馏中的监督保真度衰减
发现在线蒸馏中监督保真度衰减问题,提出Lookahead Group Reward,通过评估教师置信度分配奖励,显著提升长链推理性能。
推测性流水线解码:通过流水线并行实现更高准确性和零气泡推测
将LLM划分为流水线阶段并行处理token,推测模块并行预测实现零气泡和高接受率,显著加速解码。
微调提升语言模型的信息传达能力
提出Canopy Entropy度量,发现微调增强长度-熵率正相关,熵率与语义多样性相关性提升三倍,表明微调重组不确定性以提升信息传达效率。
PatchWorld:可执行世界模型的无梯度优化
PatchWorld将离线轨迹转为可执行Python世界模型,通过反例修复实现符号化信念状态,无需LLM调用即达76.4%规划成功率,揭示观测保真与决策效用权衡。
dMoE:具有可学习块专家的扩散大语言模型
dMoE聚合块内专家分布,将激活专家数从69.5降至14.6,保留99.11%性能,内存节省76.64%-79.84%,加速1.14-1.66倍。
RLHF的另一面:基于策略的反馈用于奖励模型自监督改进
提出SAVE框架,利用值函数对在线策略响应评分作为反馈,通过对比目标更新奖励模型,在多个基准上取得领先效果。
组合式合成:通过原子分解与重组扩展代码RLVR
ADR框架通过原子分解与受控重组生成新颖挑战性代码任务,显著扩展RLVR训练规模并提升代码能力。
MoG:面向基于图的检索增强生成的专家混合模型
MoG将知识组织为中心图与稀疏专家图,通过拓扑感知路由器动态激活,提升复杂推理性能,在MuSiQue上相对提升超20%。
将AI研究扩展到人文学科:一个基于证据的学术多Agent框架
SPIRE框架通过多Agent协作与多尺度细读,提升人文学科基于证据的论证质量,在古典文献基准上优于现有方法。
矿探者:评估MLLM智能体在《我的世界》中的开放世界探索能力
提出MineExplorer基准,通过多智能体合成工作流评估MLLM在Minecraft中的开放世界探索,发现长轨迹任务困难。
大型语言模型是否编码了制度经验?来自模糊情境下跨语言道德推理的证据
LLM在模糊道德情境中表现出与语言社区制度质量相关的推理差异,显式制度提示会抑制该差异。
EMBGuard:为具身智能体安全规划构建危险感知护栏
首个MLLM具身智能体安全护栏EMBGuard,通过评估视觉-动作对识别危险,大幅降低假阳性率,性能媲美专有大模型。
EvoGens:基于种群的启发式搜索框架用于科学想法生成
EvoGens利用进化搜索框架,将想法新颖性从0.1提至0.4,多样性从0.24提至0.55。
自回归Transformer中的认知疲劳:形式化与测量
形式化认知疲劳,提出疲劳指数FI,高准确率预测任务退化与重复,发现小模型指令调优更易崩溃。
大语言模型对中文零代词知多少?
中文零代词对LLMs仍是难题,上游任务表现差,下游翻译准确率不足50%。
TRACE:通过自适应感知探测发现持续微调中的任务特定参数
TRACE利用预热探测定位任务核心参数,仅更新活跃任务参数,缓解持续微调中的灾难性遗忘。
D³:面向大语言模型训练的动态有向图约束数据调度
提出D³框架,建模样本间动态影响图,优化训练顺序以提升学习效率,在预训练和后训练中均优于现有方法。
GRKV:长上下文大语言模型中免训练的KV缓存压缩的全局回归方法
GRKV用岭回归合并方法,最小化压缩与完整缓存的注意力差异,解决合并不平衡问题,显著提升长上下文性能。
Not All Synthetic Data Is Yours to Learn From
ConsisGuard:将安全审议与策略执行对齐的LLM护栏
ConsisGuard通过轨迹蒸馏与耦合对齐,弥合安全审议与策略执行间的差距,提升检测性能并减少执行失败。
AdaptR1:基于强化学习的自适应交织推理用于多跳问答
基于RL的步骤级自适应预算分配,动态减少多跳问答过度思考,平均思考token降69.71%,性能相当或更优。
超越静态对话:对真实、异构、演化长时记忆的基准测试
RHELM基准用LOOP模块构建动态演化、长期连贯的现实对话,结合异构数据源测试LLM记忆,发现现有方法在多源聚合和真实上下文推理上存在缺陷。
关于多语言文本嵌入排名在学习任务、语言和基准数据集上的鲁棒性
分析多语言文本嵌入在MTEB中的鲁棒性,LLM模型常领先但非一致,仅少数模型跨任务稳定。
KnowledgeGain:评估和优化面向读者学习的科学新闻生成
提出KnowledgeGain指标,量化读者知识获取以评估科学新闻质量,经实验验证可提升阅读后理解效果。
面向低资源语言维基百科的多语言与跨语言引用需求检测
研究引入18语言语料库,证明小模型微调跨语言性能优于大语言模型,适用于低资源维基百科引用检测。
TSM-Bench:检测真实维基百科编辑中LLM生成的文本
多语言多任务基准显示,现有检测器在编辑任务中准确率降10-40%,且通用数据微调无法泛化到任务特定场景。