GroundEval:有状态智能体评估中LLM评判的确定性替代方案
GroundEval确定性测试智能体证据路径,替代LLM评判,揭露无效证据导致的虚假答案。
深入探究Claude Code:当前与未来AI智能体系统的设计空间
分析Claude Code架构,提炼五个人类价值与设计原则,对比两个开源系统,提出六个未来AI智能体系统设计方向。
从行动到理解:LLM智能体中时序概念的共形可解释性
提出共形可解释框架,结合奖励建模与线性探针揭示LLM智能体时序概念方向,实现失败检测与性能提升。
可读但不可控:医学大模型幻觉的神经元级证据
医学大模型幻觉可检测(AUROC达0.86),但分布冗余,无法通过操纵相关神经元实现有效控制,检测与控制存在分离。
前沿大语言模型在阿拉伯文化与社会语言学知识上的基准测试:一个基于人类专家真值的交叉评估框架
提出阿拉伯语文化与语言学知识的交叉评估框架,发现GPT-5.4最可靠,文化任务评分更难,模型在埃及方言上表现更优。
基于奖励门控的CLIP选择性测试时去偏
RG-TTA根据偏置敏感性选择性测试时去偏,在降低偏置的同时提升零样本性能,解决了统一去偏的公平-效用权衡。
Identifying and Resolving Pitfalls of Knowledge-Based VQA Benchmarks: Auditing, Repairing, and Augmenting
LV-ROVER-MLT:基于多流投票的低资源马耳他语OCR
通过合成训练与五流Tesseract集成,将马耳他语OCR字符错误率降低70%至0.00700。
ALEE:通过以英语为中心的极小对比对实现任意语言嵌入评估
ALEE用AMR生成英语极小对比对并翻译,评估275+语言嵌入,揭示跨语言语义表示差距。
印加奇普的结构模式挖掘:无监督聚类、来源分类及圣塔谷匹配的计算验证
机器学习分析619件印加奇普,无监督聚类得三组(轮廓0.769),监督分类F1=0.86,识别绳捻方向为关键,发现殖民收藏结构并验证圣塔谷奇普。
TRACE: 面向对话数据的时序证据图上的状态感知查询处理
TRACE框架利用时序证据图和有效性标注,实现对话数据状态感知查询,提升时序与多跳推理。
超越困惑度:面向LLM测试时训练中部署记忆主张的行为评估框架
提出行为评估框架,校准测试时训练的记忆主张,揭示代理指标与部署行为间的差距。
语音游乐场:一个用于语音分析与对比的交互工具
结合Python后端与Web前端的交互式语音可视化对比工具,支持多种特征,用于语音研究、表示验证及CAPT实验。
桥梁科学遗产:面向可持续知识转移的阿拉伯语-俄语平行语料库与大语言模型基准
发布含2.7万句对的阿俄科学翻译基准,微调QLoRA模型BLEU达23.15,促进跨语言知识共享。
Indi-RomCoM:基于罗马化印地-英语混合指令评估大型语言模型的基准
该基准评估LLM在罗马化印地-英语混合指令上的表现,发现性能随混合密度下降,推理优于检测。
一次重写足矣:来自生产环境技能描述优化的经验教训
自动优化中单次LLM重写即可匹配手动调优F1(79.2%),工程时间从120分钟减至3.8分钟。
当Transformer学习“不可能”语言时,它们学到了什么?
Transformer学习“不可能”语言时,语法敏感性仅逐步下降,但生成能力显著缺陷,导致无法生成高质量长句。
当校准排名反转时:面向大语言模型公平比较的精度可控评估
提出ACE框架控制精度差异,发现全局校准指标因混淆精度致排名反转,公平比较需精度感知评估。
使用AI代理大规模自动化黑盒审计个性化算法
提出基于GenAI代理的黑盒审计框架,实现反事实分析;X平台案例显示算法放大极化右倾内容,用户意识形态影响显著。
基于结果奖励模型的Text-to-SQL测试时验证
提出GradeSQL框架,用结果奖励模型验证Text-to-SQL,在BIRD和Spider上分别提升4.33%和2.10%。
使用基于Transformer的模型结合类别权重和阈值调优的多语言极化检测
采用类别加权损失和阈值调优的Transformer模型,处理不平衡多标签极化检测,在英语和斯瓦希里语上表现优异。
Training Therapeutic Judges and Multi-Agent Systems for Human-Aligned Mental Health Support
超越干净文本:评估编码器与解码器在噪声文本中对孟加拉语事件检测的鲁棒性
孟加拉语噪声文本事件检测中,编码器干净文本优但噪声衰减,解码器更鲁棒,联合训练有效缩小差距。
Building a Multimodal Dataset of Academic Paper for Keyword Extraction
Linguistic Distancing on Social Media: Indicators of Emotion Regulation Across Age Groups
CORTEX:通过比较内部表示实现RAG中令牌级幻觉检测
CORTEX通过比较有无检索文档时的LLM内部表示,实现令牌级幻觉细粒度检测,结合前文传播与平滑提升性能。
A Semantic-Layer-Mediated Agent for Natural Language to SQL over Heterogeneous Enterprise Databases
基于参考的语音对话系统韵律与节奏评估
提出基于匹配参考的百分位评估协议,用于对话系统韵律节奏评估,提升可解释性与准确性。
真相还是诡辩?LoFa:LLM逻辑谬误鲁棒性基准
LoFa基准通过多轮辩论框架评估LLM对逻辑谬误的鲁棒性,提出LFR@k指标,揭示不同模型脆弱性差异。
基于细粒度知识实体的学术论文团队机构组成与新颖性关系研究
产学研混合团队比纯工业团队更易产生新颖论文,并关注方法-指标组合,而工业团队更关注方法-工具组合。
自然语言解释中判断质量的衡量:来自预测锦标赛的证据
引入解释质量标记(EQMs),用LLM评分推理模式,预测准确性优于传统方法,并能有效识别表现不佳者。
等等,我公平吗?——演绎刻板印象的表征与Fair-GCG的缓解方法
识别演绎刻板印象,提出Fair-GCG推理注入框架,有效提升LLM公平性、减少偏见。
从命题不对称到感知不对称:将摩擦策略优化扩展到非对称部分信息对话
将FPO从命题扩展至感知不对称,发现摩擦函数仅在各自信息视野有效,正确视角优于全知视角,提出两种标注改进。
当重排序有害时:基于不确定性的门控机制用于少样本重排序
重排序并非总是提升性能,基于不确定性的门控可降本15%-80%,并提升平均性能2%。
Triospect:一种针对多种攻击的鲁棒性统计AI生成文本检测的三维框架
提出Triospect三维框架,利用内容与表达视角,显著提升检测对多种攻击的鲁棒性。
LOPA:通过潜在序数原型对齐增强口语评估
提出LOPA正则项与SALR路由,无需大模型微调,RMSE达0.361,媲美十亿参数系统的口语评估方法。
SeKV:面向长上下文LLM推理的分层语义记忆分辨率自适应KV缓存
SeKV提出分辨率自适应KV缓存,通过熵引导语义跨度在GPU-CPU间存储,不丢弃信息,性能提升5.9%,GPU内存减少53.3%。
何为错误?非典型语音识别的双参考基准测试
非典型ASR评估存在逐字与意图两种参考,混淆导致模型排名偏差,选择合适参考至关重要。
TAG-DLM:面向文本属性图学习的扩散语言模型
提出统一文本推理与图消息传递的掩码扩散语言模型,线性化邻域并引入拓扑注意力掩码,无需微调即可适配多种图任务。
大语言模型能否想象超越二元困境的道德替代方案?
LLMs能生成道德替代方案并获偏好,但需平衡结构质量与可行性。
基于图注意网络的门控多图融合用于阿尔茨海默病检测
多视图门控图注意网络结合PMI共现图与自适应门控融合,AD检测准确率90%。
使用大型语言模型探究风格挪用:欧盟法律下版权侵权评估框架
PSALM框架揭示微调导致系统性风格挪用,仅防范逐字记忆不足以规避版权风险。
当数据库出现故障:提示LLM对话代理在任务导向对话中安全恢复
轻量提示恢复法降低LLM数据库故障时幻觉率50%以上,但残留问题仍存。
BlockPilot:面向基于扩散的投机解码的实例自适应策略学习
BlockPilot基于预填充表征预测最优块大小,适应样本差异,实现扩散式投机解码高效加速。
通过梯度反转和变分信息瓶颈缓解语音欺骗检测中的语言偏差
本文提出语言不变欺骗检测框架,利用梯度反转和变分信息瓶颈缓解语言偏差,EER相对降低36.2%。
CLExEval:一种人机协作的LLM临床推理定性评估框架
CLExEval框架揭示LLM临床推理存在冗长偏差、隐藏知识悖论等失败模式,且LLM自评不可靠,需专家验证。
面向跨基准医学问答的临床结构化等级门控LoRA
BiRG-LoRA在医学问答四个基准上平均准确率69.31%,超越MoELoRA,参数减少28.1%。
Team MKC在CLPsych 2026:通过社交媒体时间线动态捕捉与刻画心理健康变化
提出基于LLM的流水线,对社交媒体帖子序列进行心理健康分析,实现帖子级与用户级时间建模。
修正RVL-CDIP:量化错误与训练-测试重叠
发现12%标签错误和35%训练-测试重叠;错误修复提升准确率,错误校正数据改善分布外泛化(最高提升14%)。
构建用于训练和评估儿童阅读的ASR系统
针对班巴拉语儿童阅读,开源ASR系统最佳模型将词错误率降至0.22,字符错误率降至0.08,10岁以下儿童为主要误差来源。