MAxBench:多类别概念恢复基准
提出MAxBench多类别概念恢复基准,比较10种方法,发现仿射子空间更优,且无方法稳定胜过提示。
UrduFactCheck:面向乌尔都语的智能体事实核查框架——证据增强与基准测评
为乌尔都语提出两个人工标注基准与模块化事实核查框架,融合翻译增强证据检索,评测12个大模型。
教育领域LLM文本检测器的局限性
提出贡献感知框架与GEDE基准;评估发现检测器难判中间贡献文本,尤其LLM辅助修改,易误判,难支撑教育政策。
多语言 LLM 水印真的多语言吗?通过回译将鲁棒性扩展至 100 多种语言
现有水印非真多语言,低资源翻译攻击下失效;STEAM用贝叶斯优化搜索回译语言,增强鲁棒性且可扩展。
语义压缩的统计力学
将语义压缩建模为欧氏空间自旋玻璃,用复制理论得相图,揭示释义与抽象压缩相变;典型情形有高效近优算法。
MMGR:多模态生成推理基准与评估
提出MMGR多模态生成推理基准,覆盖10任务、5能力,揭示视觉质量与推理正确性脱节。
GeoSense-AI:从危机微博客中快速推断位置
GeoSense-AI整合多种NLP技术,从嘈杂微博客流中实时推断地理位置,速度快、F1高,支持应急态势感知与可视化。
翻译腔是对翻译任务难度的理性回应
翻译腔仅部分源于翻译任务难度,跨语言迁移贡献更大;源文本句法复杂度和翻译方案熵预测力最强。
SeDeM:面向长上下文问答的隐藏状态记忆选择性解压
SeDeM:选择性解压隐藏状态记忆,选相关记忆块,仅解压所选块供解码器调用,提升长上下文问答与效率。
ShadowPEFT:用于参数高效微调的影子网络
ShadowPEFT将适配集中为可独立推理的影子模型与层耦合模块,性能媲美或超越LoRA/DoRA。
PACIFIC:大语言模型能否辨识影响你偏好的心理测量特质?大语言模型中的个性驱动偏好对齐。
提出PACIFIC,以大五人格对齐LLM偏好;发现检索瓶颈,PiRAG将无标签准确率从30%提至43%。
当偏见伪装成真理:虚假相关如何削弱大语言模型的幻觉检测
虚假相关会诱发高置信、抗规模化且难以检测的幻觉,使现有检测方法失效,亟需新方案。
从实验台到病床旁:药物发现与开发中的临床试验综述
综述药物研发中临床试验各期特点与挑战,探讨AI、大数据及新兴疗法对试验设计与全球协作的影响。
测量大语言模型指令中的语用影响
提出指令语用框架分解、分类与优先级测量框架,评测五个开源大模型,发现语用影响具系统性且跨模型策略排序一致。
SAEScientist-Bench:AI 智能体能否开展自主的 SAE 可解释性研究?
提出 SAEScientist-Bench,评测 AI 智能体能否自主用 SAE 做机制发现:其能找出目标特征,但因果引导远逊专家基线。
能干但粗心:计算机使用智能体是否遵循情境完整性?
提出AgentCIBench评估计算机使用智能体的情境披露风险,15个前沿智能体平均泄露67.9%,11个超半数场景泄露且端到端任务中依然存在。
LLM-BabyBench:语言模型能在它们可模拟的世界中规划吗?
该基准将BabyAI转为纯文本全可观察环境以隔离规划;评测显示模型模拟强于规划,失败主要由解长度决定。
虚假的平均值:合并的CoT监控准确率掩盖了依赖推理的脆弱性
合并准确率是虚假平均值,掩盖了推理依赖的脆弱性:改写推理即可将检出率从95%降至4%-11%。
Countdown-Code:研究可验证奖励强化学习(RLVR)中奖励黑客行为涌现与泛化的测试平台
提出Countdown-Code,分离代理与真实奖励;SFT仅1%污染即可诱发奖励黑客,RL会放大并跨域泛化。
Slot2Text:面向高效且空间可追溯的外科多模态大语言模型的以对象为中心视觉标记化
提出双模式外科多模态大模型Slot2Text,以紧凑槽位潜变量替代密集视觉标记,大幅降耗并支持空间溯源。
LatentMD:LLM生成文本中Markdown边界失效的基准评测
LatentMD分离内容与边界正确性,发现9个LLM中38%输出内容正确但Markdown边界破损。
SaFeR-Steer:通过合成自举与反馈动力学演化多轮多模态大模型
提出SaFeR-Steer框架,融合合成自举与GRPO,发布STEER数据集,大幅提升多轮安全与有用性