SODA: 大型语言模型的半在策略黑盒蒸馏
SODA通过静态学生输出与教师最优响应对比,实现高效分布对齐,训练快10倍、内存少27%,性能超越现有方法。
AgentRedBench: 针对SaaS集成的LLM Agent动态红队测试与集成感知防御
动态红队基准覆盖215个SaaS集成攻击场景,防御模型将攻击成功率降低75-77个百分点且零误报。
UCOB:通过信用感知的在策略双向自蒸馏学习利用与演化智能体技能
UCOB以信用感知双向自蒸馏,让智能体动态利用技能,性能大幅超越基线,在ALFWorld和WebShop上分别提升23.5和18.0个百分点。
不断提示:评估视觉语言模型中的重复苏格拉底式提示
提出JKP框架评估VLM在重复追问下的稳定性,发现重复提示效果有限且模型表现差异大。
面向阿拉伯语的量子组合自然语言处理:电路拓扑中的语法、形态与词义
首次将预群语法量子NLP应用于形态丰富的阿拉伯语,电路拓扑反映语法结构,实验验证优于经典方法。
LBA:低查询预算下的文本硬标签对抗攻击
提出LBA采样方法,融合先验与后验知识,低预算下高效生成高质量对抗文本,显著超越基线。
UniSAGE:使用超结构统一静态与动态属性
UniSAGE框架通过超结构统一静态与动态属性,自动建模复杂交互,性能提升超10%。
语言模型智能体之间的潜在通信:通道、对齐与文本的局限
文本通信丢失88%特征,潜在通道未超越文本,揭示复杂概念表达局限。
UzWordnet与生成式AI:通过游戏学习乌兹别克语
结合词汇资源与生成式AI,通过四款教育游戏学习乌兹别克语,同时动态改进词汇网络。
自动进化任务特定优化的提示指南
AGOPS自动生成任务特定提示指南,修复查询模糊导致的性能大幅下降。
基于令牌时间连续扩散的语言建模
新型连续扩散语言模型,通过每个令牌独立时间步长,提升条件生成质量,高速率下优于离散模型。
Δ下的η:用边际工具效用定义LLM工具效率
提出工具效率和边际工具效用,直接量化工具调用有用性,提升效率并补充准确度指标。
Polestar:面向扩散LLM高效推理的漂移感知缓存校准与令牌提交
Polestar利用令牌漂移信号实现缓存校准与令牌提交,显著提升扩散LLM推理准确率与吞吐量。
简单性悖论:揭穿大语言模型评估中提示工程与数据集的神话
基线提示始终优于复杂推理,仅专家角色框架略有提升,复杂技术反而拉低性能。
MAPS:多智能体认知对话中建模共存主观视角与共享意义
MAPS框架通过个性化记忆与注意力,使多智能体在对话中保持主观多样性并逐步达成共识,平衡表达性与连贯性。
内省微调(IFT):训练小型大语言模型进行内省
提出内省微调(IFT),将1B模型句子定位准确率提升6倍(9.6%→60.6%),证明小模型内省能力可被训练获得。
CoEvoT:面向图-大语言模型推理的共进化思维链提示
CoEvoT通过文本-图标记重写与推理指导闭环,实现逐步状态感知证据细化,在8个数据集上超越基线。
多智能体大语言模型级联中的语义语域压缩
语义语域压缩在多智能体LLM级联中可测量且泛化,评估环节使标签可分性降低41.7%。
ReportMedSAM: 通过放射学报告指导分割
ReportMedSAM用可学习概念库替代离散提取,对比对齐临床语料,动态激活MoE,实现自由文本鲁棒分割及无干扰扩展。
语言模型可靠性与规模化的信息论极限
语言模型存在信息论可靠性上限,性能瓶颈取决于数据或容量中更稀缺资源,统一了检索增强、灾难性遗忘等现象。
T5-CSBoost:对抗性扰动鲁棒的LLM指纹识别
T5-CSBoost利用对比学习正则化风格嵌入,在多种对抗扰动下实现SOTA,显著提升LLM指纹鲁棒性。
预算子集优化用于执行感知的LLM研究构思
预算子集优化策略通过选择性优化提升LLM研究构思质量,多样性感知MMR-k方法在非重复性和成本效益上最优。
面向科学文档的异构元素感知跨版本差异检测:布局感知对齐与结构感知推理
提出布局感知异构元素感知框架,实现科学文档跨版本差异检测,统一处理文本、表格、公式、图形,F1达0.85-0.90。
HABIB_TAZ在SemEval-2026任务11中:通过合成训练和多目标优化分离形式逻辑与内容
使用合成数据和多目标损失函数,系统在英语子任务上达成零偏差和100%准确率,多语言子任务排名第六。
PReM:学习保留什么以及何时刷新以实现上下文压缩
PReM框架通过内部KV记忆学习保留和刷新上下文,采用相位分离训练,在32倍压缩下兼顾答案质量与效率。
多头潜变量控制:大语言模型智能体决策的统一接口
多头潜变量控制从冻结模型隐状态推断控制信号,优化智能体决策,显著降低大模型调用成本并保持性能。
更聪明且更便宜一举两得:字节精确的KV缓存嫁接将冻结的小模型变成验证知识飞轮
字节精确KV缓存嫁接使冻结小模型性能跃升、成本剧降,零额外内存扩展上下文,AIME得分从80.0%升至93.3%
通过概念链的隐式推理引导
大型语言模型推理脆弱,本文用自然文本隐式偏置答案,显示普通文本可系统性重构决策。
乌尔都语假新闻检测中的跨数据集泛化:基于XLM-RoBERTa和长度混淆分析的实证研究
跨数据集泛化研究发现长度混淆导致迁移崩塌,截断实验确证其影响。
MamaBench:通过反事实临床扰动评估LLM在妇幼健康诊断中的鲁棒性
MamaBench是首个妇幼健康反事实基准,BTR揭示LLM鲁棒性缺陷,EA-RAG降BTR 5.5%,但残差20%表明挑战犹存。
前半段突破拒绝:预填充越狱的机制研究
预填充通过被动自回归条件在响应前半段打破拒绝,而非抑制安全表示;监控提示侧可免疫此类攻击。
DS@GT ARC在LongEval:科学问答中的引用完整性与事实依据
通过纠正管道提升引用忠实度,主张评估需奖励严格答案依据。
断绝问题:大型语言模型无法感知提示之外的用户
LLM因缺乏对用户未知的表示导致奉承、幻觉;引入断绝模式列出未知维度可减少问题并促使用户主动提问。
MARS:面向KGQA的多跳自适应检索与SPARQL生成
MARS是一种无需微调的KGQA方法,通过结构化多跳检索自适应生成SPARQL查询,性能优异。
驾驭大语言模型实现可靠的学术督导:一项比较研究
脚手架工程可让小型语言模型在可靠性和一致性上超越大型模型,挑战“越大越好”的直觉。
LLM评估器存在跨语言偏差
大模型评估器对低资源语言评分偏高,配对准确性无法揭示此偏差,导致安全漏洞。
CityLLM:一个用于自然语言查询语义三维城市模型的框架
CityLLM框架实现自然语言查询语义3D城市模型,评估显示高正确率和100%查询成功率,轻量可扩展。
基于答案条件的思维链降低大语言模型中的可验证推理蒸馏质量
答案条件化生成的思维链会降低推理蒸馏质量,正确性筛选无法弥补,应避免使用。
大型语言模型逻辑一致性的受控改写测试
提出CRTBench基准发现LLM逻辑等价改写一致性差,准确率与一致性存在鸿沟,推理优化可提升但有限。
AI生成反馈效果如何?——基于两万余篇EFL论文草稿的内在与外在评估
研究通过两万篇论文评估AI反馈,发现专家评分与学习者反馈不一致,强调以学习者为中心的评估框架。
Routing Ceilings Are Domain-Independent: Structural Prior Injection in Code Security Vulnerability Detection
探究LLM自动作文评分中的第一语言偏见:一项针对托福作文的开放权重AI模型跨提示评估
研究首次发现LoRA微调LLM评分存在母语偏见:欧洲语言得分系统性高于东亚,跨提示泛化稳健。
D-Cut:面向批量推测解码的自适应验证深度剪枝
D-Cut自适应剪枝验证预算,高并发下加速比从1.26倍升至1.65倍,最高达3.0倍。
Latent Trajectory Discrimination for AI-Generated Text Detection
SEED:面向智能体强化学习的自进化在线策略蒸馏
提出自进化框架,将在线轨迹转化为事后技能并蒸馏回策略,提升智能体强化学习性能和样本效率。
数字万神殿:利用大语言模型智能体模拟与审计联盟形成
提出多智能体框架,用DPO和RAG塑造党派立场,溯源分析协议条款,预测现实联盟结果。
展示你的推理方式,我便能道出你是谁:用于鲁棒LLM作者归属的推理图
提出推理图神经网络方法,在改写攻击下准确率比基线高27%,对未知模型版本高19%,实现鲁棒作者归属。
自闭症作者的写作被误判为AI生成
AI检测模型对自闭症作者存偏见,其作品更易被误判为AI生成,呼吁伦理审查。
OmniaBench:跨多样场景评估通用AI智能体的基准测试
OmniaBench基准测试评估通用AI智能体,覆盖多领域任务,揭示规划与自适应修正能力局限。
黄金引导的程序化蒸馏用于混合表格与文本的金融推理
用执行验证的Python程序替代自然语言理由,从大模型蒸馏可靠数值推理到小模型,在金融推理中超越72B教师模型。