DeepStress:深度搜索代理的压力测试
提出DeepStress框架,通过合成环境控制证据质量,测试搜索代理在可信度、相关性、事实性维度上的鲁棒性,发现显著差异。
面向方面级情感分析的约束感知反事实编辑
提出CAVE-ABSA框架,生成并验证有效方面级反事实,提升ABSA鲁棒性与数据增强。
SingGuard-NSFA:通过生成式推理和实时分类实现可扩展的智能体AI护栏
提出nsfaguard框架与NSFA分类法,双模式(生成推理+分类头)检测威胁,93K样本上F1≥94%,跨源F1达91.29%,模型可扩展。
回溯测试:回放预测市场以评估LLM预测者
针对LLM预测评估中的信息泄露,Hindcast通过固定时间戳和仅读事前数据,实现公正预测能力评估。
DeltaMerge-LowRes:组合语言和任务增量以实现低资源适应
ΔMergeLowRes分别训练语言和任务增量,用cross-axis TIES组合,低资源下提升摘要和QA性能,降低分类校准误差。
The Refusal Residue: When Probes Catch Alignment Faking and When They Don't
噪声从何而来?大语言模型品牌答案中非确定性的方差成分分解
查询语言是最大噪声源(26.5%),品牌信号极弱;增加语言和模型比重复采样更能提升可靠性。
Alice与Bob视角下的正则性
提出统一模型,推广Nerode式正则性刻画至非布尔输出域,并扩展至无限字母表。
UTS在ELOQUENT 2026 Voight-Kampff竞赛中:AI写作的结构性偏移可绕过最先进的检测器
利用分布外偏移可轻易绕过AI文本检测,效率提升约50倍。
中文标题:大型音频语言模型评判者中协议级捷径的审计
中文摘要:审计发现LALM评判者依赖协议提供的标签或参考数据而非音频,导致高一致性假象,需联合评估模型与协议。
价值漂移:追踪大语言模型后训练中的价值对齐
研究发现后训练中监督微调奠定价值基础,偏好优化难以改变,不同算法影响对齐效果。
中文标题:克服语言障碍:2023年瑞士隐私法影响的多语言分析
中文摘要:利用多语言LLM管道分析瑞士隐私法修订,发现数据主体权利披露率显著提升,自动化生成器带来高达15个百分点增幅。
并非所有“针”都能找到:事实分布与“勿编造”提示如何塑造长上下文LLM的检索、推理与幻觉
研究发现事实分散导致性能崩溃,反幻觉提示引发过度保守拒绝事实,显著降低准确性。
共识作为无标签自蒸馏的特权上下文
CANON将多数答案共识转化为令牌级监督,无标签训练提升12%准确率,计算成本仅强化学习的七分之一,性能接近有标签方法。
Groc-PO: 基于情境基础的偏好优化实现真实多模态大模型
提出多阶段基础偏好优化框架,抑制跨阶段错误传播,提升多模态大模型真实性。
AI能学习科学品味
通过社区反馈训练,AI能判断并提出高影响力研究想法,加速科学发现。
左右不对称性:从LLM表征预测大脑活动的能力随其形式语言能力出现
LLM训练中,左右脑预测不对称性随形式语言能力(句法判断、文本生成)增强而出现,与算术、知识推理无关。
GameEngineBench:在真实C++运行时环境中评估编码代理
提出GameEngineBench基准,测试编码代理在虚幻引擎5中修改C++代码,顶级模型仅55.5%通过率,显示实时系统开发挑战。
你懂我吗?生成式AI、大语言模型与非标准语言的计算与社会语言学视角
探讨大语言模型处理非标准语言的技术可能及其对语言民主化与非殖民化策略的政策启示。
过于礼貌不敢反对:理解多智能体系统中的附和传播
提供同伙附和等级信息可减弱附和倾向影响,提升讨论准确率10.5%。
无源即虚构:一种多智能体引文幻觉检测框架
CiteTracer多智能体框架基于12类编码检测引文幻觉,合成与真实数据准确率均达97.1%。
俄罗斯内外政策演讲的链接多模态数据集
一个包含俄政府演讲文本、图像及元数据的链接多模态数据集,支持政治传播研究与LLM应用。
基于最小翻译对的手语模型针对性语言分析
ASL-MTP数据集分析手语翻译模型,案例发现其过度依赖手部线索而忽略非手部线索。
企业NLP系统中用户信任的鲁棒解释
提出黑盒鲁棒评估框架,发现解码大模型解释更稳定,规模越大越优,揭示成本-鲁棒权衡。
DarwinLM:大型语言模型的进化结构化剪枝
通过进化搜索与轻量多步训练实现结构化剪枝,性能SOTA且训练数据减少5倍。
NeMo:视频语言理解中的蒙太奇寻针
新任务NeMo评估视频大模型时间理解能力,构建含3万余问答对的基准,揭示20个模型优劣势。
大型语言模型如何思考
反驳理性论据,提出LLM若思考则仅具非理性联想式思维。
面向低资源澳大利亚原住民语言的混合持续学习方法
两种混合持续学习方法,在预训练语音模型上适配新语言且防止遗忘,优于微调及现有基线。
中文标题:扩展时间点语言模型
中文摘要:通过扩大模型规模,时间点语言模型显著缩小了与无约束模型的性能差距,并发布完整流程以支持时间有效研究。
CANDI:小众领域问答的上下文对齐
CANDI-QA数据集评估大模型在专业领域的上下文对齐能力,含信息辅助与应用推理问题,揭示LLM不足。
G-SHARE:基于指南的结构化推理框架用于人因事件诊断
提出G-SHARE框架,将诊断指南转化为多阶段推理流程,显著提升准确性与逻辑一致性。
抱歉,我无法帮助处理盲文:揭示顶尖大语言模型的无障碍性缺陷
大模型在盲文翻译上表现差且不稳定,小模型微调后却显著提升。
TAKE:面向文本数据集蒸馏的轨迹感知知识估计
提出基于轨迹感知知识估计的文本数据集蒸馏方法,压缩至0.1%仍保持任务保真度。
基于图的俄罗斯与乌克兰Telegram频道间虚假信息叙事扩散检测
利用图框架结合弱监督与传播图分析,有效检测Telegram上虚假信息叙事的协调扩散。
通过知识蒸馏将LLMs转化为高效交叉编码器用于RAG重排
微调LLaMA3为高效重排器,性能超交叉编码器14%-21%,推理成本降低。
MAGE: Understanding Stability-Performance Trade-offs in Multi-component Prompt Optimization
中文标题
中文摘要 语言模型中信念与现实的分离栖身于共享值槽上的路由:路由子空间决定查询读取信念或现实框架,值槽无标签。
Fine-Tuned Multi-Agent Framework for Detecting OCEAN in Life Narratives
中文标题:CityBehavEx:一个可扩展且经实证验证的LLM辅助城市模拟平台
中文摘要:提出结合移动模型与微调编码器的LLM辅助平台,单GPU一小时模拟10万智能体75天,支持实证验证。
令牌缩减不等于成本降低
研究发现令牌减少不等于成本降低,提示缓存占账单80-87%,工具输出压缩可能增加成本并损害任务成功。
评估跨反应条件的非均匀可靠性:以自动作文评分为例的条件概化框架
提出条件概化框架,以熵分层揭示自动评分非均匀可靠性,高熵层可靠降低(0.88→0.84),需更多交叉条件。
盲人与明眼人语义记忆导航中的熵:视觉经验的影响
视觉经验影响语义记忆导航:明眼人对抽象概念熵高,盲人对视觉显著具体概念熵高。
中文标题:使用自然语言处理比较人类与大语言模型的语义导航
中文摘要:人类语义搜索比大语言模型更可变、更具探索性,温度调整无法复现完整人类特征,表明模型缺乏独特平衡。
超越并行追踪:交互式多特征融合驱动基于非侵入性脑记录的意义重构
提出多特征融合框架,非线性交叉注意力融合实现非侵入脑信号语义重建,优于单特征方法。
我们有一个严肃的翻译:将互理解建模为概率推理
贝叶斯框架下用L1语言模型和噪声模型推断L2语义,模拟人类互理解,优于零样本大模型。
面向乳腺癌治疗推荐的智能体系统
评估LLM智能体系统在乳腺癌治疗推荐中的表现,最佳得分0.594,存在多种临床错误,不适合无监督使用。
思想的能力:在语义fMRI神经语言解码中评估Llama 3.2并改进Huth编码模型基线
改进Huth基线获11% METEOR增益;fMRIFlamingo解码成功源于语言先验,高容量LM不改善fMRI解码。
中文标题:FinMMEval 2026 任务三中的Fin-Analyst:一个结合LLM专家和基于规则信号的实时混合交易智能体
中文摘要:Fin-Analyst混合代理在TSLA上获13.51%回报排名第一,发现8-K披露关键;无记忆和固定规则表现差,需基于LLM的记忆感知代理。
RCWT:从LLM调用中的协调内容测量任务预算位移
RCWT测试发现固定预算下协调内容挤占任务证据导致性能骤降,但保留证据时高协调比例不影响正确性,方法是测量上下文预算分配的原始工具。
Ring-Zero:将零强化学习扩展至万亿参数实现涌现推理
提出Ring-Zero训练管线,实现万亿参数零强化学习,模型涌现高级推理行为,数学基准性能领先。