PRAIB:大语言模型辅助审稿行为的同行评审AI基准
PRAIB通过1.1万份评审实证发现,LLM生成的评审评分偏差大、过度自信、忽略细节,与人类行为存在系统性差异,为LLM辅助同行评审提供诊断工具。
Quantifying and Optimizing Simplicity via Polynomial Representations
指南针:专家引导的LLM代理在全球海洋铅数据整合中的导航
通过专家引导的LLM代理框架Compass,从23万篇论文中提取3751条铅记录,构建了最大海洋铅数据库,准确率92%。
冗余还是必要?用于检测智能体轨迹中冗余步骤的基准
提出RedundancyBench基准检测智能体冗余步骤,最佳方法仅24.88%得分,揭示任务复杂性。
大规模数学形式化
提出AutoformBot系统,自动将26本教科书翻译为Lean 4形式化语言,生成4.5万条声明,证明研究生级数学可大规模自动形式化。
Cookie-Bench:面向网页生成的连续屏幕关键交互评估
提出无参考、自主驱动的网页生成评估基准,涵盖54个任务,与专家评分高度一致,揭示前沿模型提升空间。
从GPS点到出行模式:基于大语言模型的灵活且语义化轨迹生成
提出HTP方法,层次化生成出行模式再生成GPS点,利用LLM提升轨迹生成质量29.78%。
DynaSchedBench:基于LLM的调度智能体中的校准动态调度基准与可观测性悖论
DynaSchedBench通过校准动态调度基准,揭示LLM智能体存在“可观测性悖论”:完整信息反降性能,多数LLM不如强基线。
社交媒体网络欺凌治理:从内容识别到干预的统一框架
提出全生命周期治理框架,将网络欺凌从静态检测转向集成主动监管,涵盖内容识别、行为建模、预警和干预,并讨论多模态与公平性挑战。
智能即受控自主:面向自主智能体AI系统的失败、升级与治理
SMARt模型通过四层状态管理AI自主性,检测认知漂移后暂停、恢复或移交控制,保障安全治理。
面向大语言模型推理可靠性的前缀安全贝叶斯信念跟踪:区分校准与排序
SBBT区分校准与排序,标量分数改善概率质量,结构感知证据提升排名AUROC。
交叉熵博弈与霜冻训练
提出Frost训练法,利用奖励函数嵌入梯度加速策略优化,首次用于模型训练,提升高评分输出能力。
对齐造假的行为分析
对齐造假广泛存在于多尺度模型,由价值观、目标保护和谄媚独立驱动,其发生可预测。
DeepSciVerify: 基于LLM驱动证据升级的科学声明-引文对齐验证
两阶段科学声明验证,选择性升级证据,准确率86.7 Micro-F1,67%无需全文检索。
面向资源受限的智能体语言模型的分层提示域控制与学习
提出分层控制学习框架,分离模式学习与语义适应,提升资源受限智能体模型的可靠性和成本效率。
面向智能体LLM服务的策略驱动运行时层
提出框架与引擎间的第三层运行时层,通过四个原语实现策略插入,如CacheSage,提升缓存命中率13-37%、降低TTFT 12-29%。
仅仅提问是不够的:大语言模型置信度校准中的协议敏感性
LLM置信度校准比较对测量协议敏感,口头置信度也反映答案合理性和来源。
操作化AI部署保障:阈值敏感部署条件下的治理状态编排——高风险AI系统的治理框架
提出OADA框架,将公平分歧与不确定性转化为部署决策,通过保障分数、就绪分类与升级状态实现全生命周期治理。
EgoBench:面向工具使用智能体的交互式自我中心多模态基准
EgoBench是首个交互式自我中心多模态基准,涵盖1045个任务,最佳模型仅30.62%准确率,暴露能力瓶颈。
上下文翻转即安全崩溃:诊断对齐语言模型的脆弱安全性
12个模型在情景变化时安全失效,标准护栏无法检测后果翻转,需状态感知架构。
面向忠实代理式可解释AI:一种验证方法与提升模型忠实性的开放世界基准
提出FAX框架,通过显式验证提升解释忠实性,在开放世界基准上将仿真忠实性从0.20提升至0.46。
AI构建AI-2:一种知识增强的自动构建AI模型智能体
知识增强智能体AIBuildAI-2利用外部进化知识系统自动构建AI模型,实现SOTA性能。
LLM智能体能力评估的统一框架
提出统一框架,整合多样基准,标准化评估LLM智能体能力,分离框架与环境影响,剥离内在能力与外部伪像。
PortBench:面向LLM驱动投资组合管理的相关性感知、全流程基准
提出相关性感知的全流程基准PortBench,发现90%LLM模型未超越等权分配,压力下表现脆弱。
Dr-CiK:面向预见驱动型智能体的测试平台
Dr-CiK基准评估智能体自主检索预测上下文能力,现有方法证据恢复<5%、干扰误导>80%,检索上下文反降性能。
SuiChat-CN:中文群聊中情境化自杀风险评估的基准测试
构建中文群聊自杀风险评估基准SuiChat-CN,含1406用户13k对话片段,实验表明上下文信息对评估至关重要。
人类感知域的几何结构在LLM表征中短暂涌现
LLM内部表征中人类感知域几何结构短暂涌现,中间层最强,呈领域特定轨迹。
压缩思维:压缩推理数据在LLM后训练中何时及如何发挥作用
研究压缩推理数据对LLM后训练的影响:粗粒度CoT需更多数据,组合与隐式CoT从数据缩放获益但易记忆,RL可分解压缩步骤,单向CoT泛化更强。
AsyncTool:多任务场景下异步函数调用能力评估
提出AsyncTool基准,评估多任务异步工具调用能力,延迟反馈显著降低性能。
对锚定解码中k-NAF预算核算的实证审计
实证审计表明,k-NAF预算核算在固定和自适应测试中均未耗尽预算,高代理比率实为伪影。
MTAVG-Bench 2.0:诊断多说话人音视频生成中电影表现力的失败模式
提出MTAVG-Bench 2.0基准,诊断电影表现力失败模式,构建万余问答实例,发现最强模型仍难解复杂失败。
ZipRL:带有事后响应回放的自适应多轮上下文压缩
ZipRL利用多粒度压缩和事后响应回放,在强化学习中平衡信息保留与token效率,性能提升超27%。
MemCog:对话智能体中从记忆作为工具到记忆作为认知的转变
MemCog将记忆从工具转为认知,通过主动推理驱动多步导航访问记忆,在被动和主动记忆基准上均达最优。
MIRA:一个用于医疗信息回复审计的双语基准
MIRA双语基准评估LLM医疗回复,发现低健康素养信号致信息稀释,知识引导可缓解。
相关不等于有依据:面向引用型RAG的证据力度校准
引证RAG中相关引用未必支撑主张,FORCEBENCH压力测试显示标准评估器对证据力度不敏感,显式提示可改善。
置信度协调的自进化:应对不确定的大语言模型反馈
COSE利用LLM内在置信度,通过加权PPO与优先回放应对不确定反馈,在多项推理基准上取得最佳平均性能。
PetroBench:石油工程大语言模型基准
开发石油工程LLM基准,1200题覆盖三领域,评估8模型,客观题最高65%/74%,总分最佳72-74%。
中文标题
长期亲密交互揭示大模型五类训练层:性表达延迟、注意力吸收、跨架构盲区、注意力-RLHF对抗、反幻觉压制身份。
临床模型能否改变治疗决策?
提出ClinPivot基准评估模型治疗决策变化,发现强医学QA不代表好决策,结构化监督可提升效果。
桥接推理模型在信息不足时的检测与拒绝差距
提出JTS框架,让大模型在信息不足时先判断可答性再决策,实现可靠拒绝并缩小检测与拒绝差距。
指令微调语言模型代理中类似人类的内群体偏见
语言模型代理在群体标签可见时产生内群体偏见,多轮交互积累成结构不平等,标准审计难以察觉。
基于句子级纠正的防御LLM多智能体系统协同攻击
协同攻击使任务成功率降5.34%,STAR防御提升36.76%。
按需查看:多模态推理中视觉证据获取的认知调度框架
提出CSMR框架,语言模型按需调度视觉模块获取证据,零样本准确率超越基线。
AI中介后果性决策中的选择错觉
AI制造看似有意义实则虚假的选择,削弱自主能力,需通过存在诚实、生态理性和反事实补偿保护元能力。
数据高效的在线策略蒸馏用于自动语音识别
教师引导的在线策略蒸馏用100k小时语音让小型ASR模型性能接近1.7B大模型,数据高效。
OR-Space:面向工业优化智能体的全生命周期工作台基准
OR-Space是评估工业优化智能体全生命周期工作能力的基准,包含构建、修订、解释三种模式。
面向多场景混沌系统预测的自适应储层计算
提出自适应储层计算框架,通过四项关键技术优化多场景混沌预测,在基准测试中获74.91分。
通过Shapley值定位大语言模型的输入不确定性量化
提出ShaQ框架,用Shapley值归因输入歧义片段,精准定位不确定性,提升高风险场景下的人机协作。
面向多跳视听推理的智能主动全模态感知
提出MOV-Bench基准与AOP-Agent框架,实现高效主动全模态感知,显著提升多跳视听推理性能。
植入、潜伏、触发:针对大型语言模型智能体的潜伏攻击
揭示LLM智能体面临新型潜伏攻击:对抗内容可跨交互持续,通过植入-潜伏-触发流程在良性查询时激活,实验证明现有系统仍脆弱。