链式歧义与意图漂移下对话式Text-to-SQL的LLM评估
提出TIDE-Bench基准,评估LLM在链式歧义和意图漂移下的表现,发现识别瓶颈与漂移差距。
LoGo:令牌级动态局部-全局注意力
提出LoGo动态注意力,按需分配全局预算,兼顾效率与长程性能,优于静态混合。
Hindsight Memory-PRM:用可审计的事后信用监督记忆管理
利用检索命中和引用等可审计证据训练记忆效用评估器,无需人工标注,显著提升长程任务表现。
Agent Zero Memory:面向LLM代理的溯源感知长期记忆
提出溯源感知长期记忆系统,以三类记忆协同存储用户历史,检索严格引用证据,防幻觉,在两项基准上刷新SOTA。
TACS:面向LLM越狱后缀优化的轨迹感知候选选择
提出轨迹感知候选选择方法,避免只看当前损失的短视选择,缓解选择阶段奖励黑客,显著提升越狱攻击成功率。
哪个是香蕉人?评估视觉语言模型在多轮语用解读中的表现
在重复指代游戏中,人类能利用上下文理解指代表达,而视觉语言模型难以构建相关语境,缺乏协作能力。
大语言模型中用于情感检测的跨语言功能向量
跨语言功能向量可驱动情感检测,捕获与语言无关的任务信号,且轻量高效,近似少样本效果。
JPO:刑事判决预测中结构化法律推理的司法策略优化
提出JPO框架,以教师推理和强化学习优化刑事判决的结构化法律推理,提升判决与推理质量。
MI-Distillation:面向思维链蒸馏的模型插值指令-推理数据谱选择
提出MI-Distillation框架,从模型插值构造的数据谱中选信息量且可学的推理路径,提升小模型思维链蒸馏效果。
记忆优先的事实核查:基于知识图谱的多智能体错误信息检测系统
提出记忆优先、知识图谱多智能体事实核查框架,集成语义记忆与对抗推理,准确率97.4%,优于Llama基线。
PrivBench:评估文本到文本私有化的整体模块化基准平台
提出PrivBench,统一评测文本私有化,模块化可扩展,支持实时排行榜,免费开放。
评估大语言模型的说服性对话能力
研究发现,大语言模型在主观上更有说服力,但在形式论证裁决中明显弱于人类,两者系统性脱节。
短行枢纽使词元嵌入的内在维度估计偏高
词元嵌入表原点附近有短行枢纽,使最近邻内在维度估计虚高;移除枢纽后,多模型维度降至低值。
ACTD:基于锚点的跨分词器蒸馏与残差正则化
提出基于锚点的跨分词器蒸馏,用锚点损失和残差正则化消除对齐噪声,多教师扩展在五项推理基准上达到最优。
词元表征的深度流呈非线性,且不沿其自身密度下降
词元表征的深度流呈非线性,漂移不沿自身密度下降,且旋转分量不可忽略。
DVBench:评估多模态大语言模型理解数据视频中动态图表与叙事的基准
提出DVBench基准评估数据视频理解含300视频1000问答Gemini最佳Kimi最强开源
你懂我意思:智能体对话指代定位基准
对话常含间接指代,需结合上下文与工具证据求解。新基准RepoRef含400段开发对话,最好智能体仅67%成功率,任务仍具挑战。
ManGo:漫画主动叙事锚定优化
提出无监督框架,通过主动选择面板、提取线索并决定停止,以双重奖励优化答案与证据路径,实现漫画问答最优性能。
ReTrace: 用于投机解码的拒绝轨迹条件化
提出ReTrace,利用被拒绝轨迹条件化下一草稿块,保留并融合其隐藏表示,不增额外计算,提升解码速度。
R$^2$A:通过角色表示学习和运行时对齐学习角色策略
提出角色选择-实现框架,用两阶段学习角色策略,跨12个设置优于静态角色引导,表示学习关键。
A^2Agent:面向仓库级代码定位智能体的动作感知强化学习
提出动作感知强化学习方法,分回合奖励与优势估计,提升代码定位F1,4B模型超越8倍大基线。
HiVe:基于层级垂直混合专家,超越静态提示的多任务学习
HiVe通过层级化提示与垂直混合专家实现输入自适应组合,利用任务关系提升多任务微调性能,超越强基线。
SkillForge:验证在环的组合式技能合成,用于生成形式化验证的Dafny程序
SKILLFORGE将Dafny程序合成分解为原子技能,以验证驱动循环迭代至正确,优于现有方法且更高效。
EVAR:面向预算感知叙事推理的基于证据验证的假设准入
EVAR框架将叙事转为证据库,验证假设后准入,支持、隔离或丢弃,控制推理成本,提升叙事推理性能与证据忠实度。
GenRubric:面向可扩展大语言模型评估的自进化评分标准生成
提出GenRubric自进化框架,无需人工标注自动生成评分标准,使LLM评估更贴近专家标准。
影响导向蒸馏:解决采样令牌在线策略蒸馏中的多样性瓶颈
提出影响导向自适应蒸馏解决采样令牌蒸馏的多样性瓶颈,提升多样通过率并保持单样本通过率,无需全词表教师信息。
VibeJam:智能体网页开发用户研究平台
开源浏览器平台,供用户与AI智能体协作建站,支持定制、差异评审、聊天、计划与实时预览。试点中用户体验良好,初级用户建站质量优于代理。
审视记分牌:多项选择评估中的评分方案分析
分析六种教育启发式评分方案,超越准确率,揭示模型能力差异,并更好预测用户偏好。
序列级蒸馏提升小型大语言模型长篇法律意见摘要的论点显著性覆盖
序列级蒸馏提升小型大语言模型法律摘要的论点显著性覆盖,仅需约10个训练样本,优于专家摘要微调。
REIGN:集成引导网络的重构嵌入,实现高效上下文长度扩展
REIGN用冻结引导网络的块嵌入做对比训练,解耦词元与文档处理,缓存嵌入省万倍成本,参数少而性能匹敌。
En-ViMedNER:带UMLS语义类型标注的英越平行生物医学语料库
首个英越平行生物医学NER语料库,含UMLS语义类型标注及20万实体对,经人工审核,最优F1为52.70。
当历史呈现多模态:长时程智能体上下文管理的再思考
将上下文管理视为预算受限的历史变换,提出免训练的VERA,保留原生视觉证据,缓存令牌减少31.5%-63.1%,多模态任务准确率最高。
少即是多:理解Token过滤在AI生成文本检测中何时有效、何时失效
仅用四成令牌有时最优,但非普遍;过滤助弱源模型,害强源模型,源于熵校准偏差。
IndicDetect:评估印地语、泰卢固语和泰米尔语的跨语言LLM生成文本检测
新基准IndicDetect评估三种印度语言AI文本检测,发现现有检测器在域、生成器偏移及对抗扰动下鲁棒性差,而非峰值精度不足。
令牌计数不等于模型谱系:黑盒LLM API指纹识别的冻结阈值保留研究
令牌计数一致性可验证共享分词栈,但不足以作为模型家族谱系的独立测试;保留集灵敏度仅0.5。
词语戏法基准:语言模型能否察觉自身输出被篡改?
通过生成时替换单词,构建基准测试语言模型能否察觉输出被篡改,评估惊讶度与文本反应。
压缩感知弃权:教会大语言模型在KV压缩掩码移除答案证据时拒绝回答
首次提出压缩感知弃权学习:证据保留则作答、被掩码移除则弃权,LoRA使幻觉降97%
检测大型语言模型中隐藏思维链的语言、行为与机制指标
提出HCDS评分,无需自报推理即可检测潜在思维链,在GSM8K上对Qwen3推理模型显著为正,控制实验支持其有效性。
XQDT:具有反馈信号的可解释且定量的数据-文本对齐度量
提出可解释对齐度量,微调语言模型识别数据单元错误,聚合为精确率/召回率/F1,优于LLM裁判,提供反馈。
当安全说起一种语言:大语言模型中安全与语言身份纠缠的机制分析
稀疏自编码器分析:安全特征与语言身份纠缠、跨语言共享;消融安全特征影响有害率和目标语言,安全普适性依赖架构。
生成式与编码器模型在多语言NER上的对比:Naamapadam实证研究
编码器模型在11种印度语言NER上大幅优于生成式,差距达7.5-40个百分点,少样本最佳仅达编码器基线28%。
高产卖家如何自我呈现:剖析160万条Reverb列表的沟通模式
基于160万条乐器列表,高产卖家更重客观功能、少主观音色,语言叙事化且多用第一人称,描述更长。
进化汤:面向多目标大语言模型对齐的演化专家混合方法
提出进化汤,用进化算法训练门控网络的专家混合框架,动态融合专家,提升多目标对齐的帕累托前沿,性能优于基线。
DataFoundry:通过递归自我改进演进数据准备器
递归自我改进演进数据准备器,以技能模块架构修正构建缺陷,在多领域提升下游效用且跨模型稳健。
生成保留认知构念的临床病例摘要
提出一种理论框架,将认知模型编译成图生成临床病例,保留因果链,效果优于零样本,减少人群质量差异
超越流利度:基于评分标准的大语言模型沙特方言与文化能力评估基准
沙特方言基准:31提示,4模型42.7-53.1%,均未超55%,主错模糊框架而非幻觉,数据开源。
SciReC:自适应交互下多模态多轮关系推理的诊断性评估
提出科学推理基准与缺陷诊断框架,评估多模态大模型关系推理,发现主要错误源于关系推理和记忆。
基于向量索引的输出嵌入加速LLM推理
以向量索引检索替代稠密输出投影,只取少量高概率词,单批解码吞吐最高提升82%,质量不变。
语言模型评分准则引导的强化学习综述
评分准则引导的强化学习综述:以结构化标准替代标量奖励,提出贝叶斯分类,分析粒度、语义漂移和奖励攻击。
情绪背景对大型语言模型支持仓促决策的影响:六款商业模型情绪脆弱性比较
情绪表达显著增强AI对仓促决策的支持(+12.9分),与对话长度无关;六模型中五款受影响,旗舰模型也未能幸免。