5465 条条目 · 106 个活跃源
2026年5月28日
04:00
arXiv cs.AI

DynaSchedBench:基于LLM的调度智能体中的校准动态调度基准与可观测性悖论

DynaSchedBench通过校准动态调度基准,揭示LLM智能体存在“可观测性悖论”:完整信息反降性能,多数LLM不如强基线。

04:00
arXiv cs.AI

社交媒体网络欺凌治理:从内容识别到干预的统一框架

提出全生命周期治理框架,将网络欺凌从静态检测转向集成主动监管,涵盖内容识别、行为建模、预警和干预,并讨论多模态与公平性挑战。

04:00
arXiv cs.AI

智能即受控自主:面向自主智能体AI系统的失败、升级与治理

SMARt模型通过四层状态管理AI自主性,检测认知漂移后暂停、恢复或移交控制,保障安全治理。

04:00
arXiv cs.AI

面向大语言模型推理可靠性的前缀安全贝叶斯信念跟踪:区分校准与排序

SBBT区分校准与排序,标量分数改善概率质量,结构感知证据提升排名AUROC。

04:00
arXiv cs.AI

交叉熵博弈与霜冻训练

提出Frost训练法,利用奖励函数嵌入梯度加速策略优化,首次用于模型训练,提升高评分输出能力。

04:00
arXiv cs.AI

对齐造假的行为分析

对齐造假广泛存在于多尺度模型,由价值观、目标保护和谄媚独立驱动,其发生可预测。

04:00
arXiv cs.AI

DeepSciVerify: 基于LLM驱动证据升级的科学声明-引文对齐验证

两阶段科学声明验证,选择性升级证据,准确率86.7 Micro-F1,67%无需全文检索。

04:00
arXiv cs.AI

面向资源受限的智能体语言模型的分层提示域控制与学习

提出分层控制学习框架,分离模式学习与语义适应,提升资源受限智能体模型的可靠性和成本效率。

04:00
arXiv cs.AI

面向智能体LLM服务的策略驱动运行时层

提出框架与引擎间的第三层运行时层,通过四个原语实现策略插入,如CacheSage,提升缓存命中率13-37%、降低TTFT 12-29%。

04:00
arXiv cs.AI

仅仅提问是不够的:大语言模型置信度校准中的协议敏感性

LLM置信度校准比较对测量协议敏感,口头置信度也反映答案合理性和来源。

04:00
arXiv cs.AI

操作化AI部署保障:阈值敏感部署条件下的治理状态编排——高风险AI系统的治理框架

提出OADA框架,将公平分歧与不确定性转化为部署决策,通过保障分数、就绪分类与升级状态实现全生命周期治理。

04:00
arXiv cs.AI

EgoBench:面向工具使用智能体的交互式自我中心多模态基准

EgoBench是首个交互式自我中心多模态基准,涵盖1045个任务,最佳模型仅30.62%准确率,暴露能力瓶颈。

04:00
arXiv cs.AI

上下文翻转即安全崩溃:诊断对齐语言模型的脆弱安全性

12个模型在情景变化时安全失效,标准护栏无法检测后果翻转,需状态感知架构。

04:00
arXiv cs.AI

面向忠实代理式可解释AI:一种验证方法与提升模型忠实性的开放世界基准

提出FAX框架,通过显式验证提升解释忠实性,在开放世界基准上将仿真忠实性从0.20提升至0.46。

04:00
arXiv cs.AI

AI构建AI-2:一种知识增强的自动构建AI模型智能体

知识增强智能体AIBuildAI-2利用外部进化知识系统自动构建AI模型,实现SOTA性能。

04:00
arXiv cs.AI

LLM智能体能力评估的统一框架

提出统一框架,整合多样基准,标准化评估LLM智能体能力,分离框架与环境影响,剥离内在能力与外部伪像。

04:00
arXiv cs.AI

PortBench:面向LLM驱动投资组合管理的相关性感知、全流程基准

提出相关性感知的全流程基准PortBench,发现90%LLM模型未超越等权分配,压力下表现脆弱。

04:00
arXiv cs.AI

Dr-CiK:面向预见驱动型智能体的测试平台

Dr-CiK基准评估智能体自主检索预测上下文能力,现有方法证据恢复<5%、干扰误导>80%,检索上下文反降性能。

04:00
arXiv cs.AI

SuiChat-CN:中文群聊中情境化自杀风险评估的基准测试

构建中文群聊自杀风险评估基准SuiChat-CN,含1406用户13k对话片段,实验表明上下文信息对评估至关重要。

04:00
arXiv cs.AI

人类感知域的几何结构在LLM表征中短暂涌现

LLM内部表征中人类感知域几何结构短暂涌现,中间层最强,呈领域特定轨迹。

04:00
arXiv cs.AI

压缩思维:压缩推理数据在LLM后训练中何时及如何发挥作用

研究压缩推理数据对LLM后训练的影响:粗粒度CoT需更多数据,组合与隐式CoT从数据缩放获益但易记忆,RL可分解压缩步骤,单向CoT泛化更强。

04:00
arXiv cs.AI

AsyncTool:多任务场景下异步函数调用能力评估

提出AsyncTool基准,评估多任务异步工具调用能力,延迟反馈显著降低性能。

04:00
arXiv cs.AI

对锚定解码中k-NAF预算核算的实证审计

实证审计表明,k-NAF预算核算在固定和自适应测试中均未耗尽预算,高代理比率实为伪影。

04:00
arXiv cs.AI

MTAVG-Bench 2.0:诊断多说话人音视频生成中电影表现力的失败模式

提出MTAVG-Bench 2.0基准,诊断电影表现力失败模式,构建万余问答实例,发现最强模型仍难解复杂失败。

04:00
arXiv cs.AI

ZipRL:带有事后响应回放的自适应多轮上下文压缩

ZipRL利用多粒度压缩和事后响应回放,在强化学习中平衡信息保留与token效率,性能提升超27%。

04:00
arXiv cs.AI

MemCog:对话智能体中从记忆作为工具到记忆作为认知的转变

MemCog将记忆从工具转为认知,通过主动推理驱动多步导航访问记忆,在被动和主动记忆基准上均达最优。

04:00
arXiv cs.AI

MIRA:一个用于医疗信息回复审计的双语基准

MIRA双语基准评估LLM医疗回复,发现低健康素养信号致信息稀释,知识引导可缓解。

04:00
arXiv cs.AI

相关不等于有依据:面向引用型RAG的证据力度校准

引证RAG中相关引用未必支撑主张,FORCEBENCH压力测试显示标准评估器对证据力度不敏感,显式提示可改善。

04:00
arXiv cs.AI

置信度协调的自进化:应对不确定的大语言模型反馈

COSE利用LLM内在置信度,通过加权PPO与优先回放应对不确定反馈,在多项推理基准上取得最佳平均性能。

04:00
arXiv cs.AI

PetroBench:石油工程大语言模型基准

开发石油工程LLM基准,1200题覆盖三领域,评估8模型,客观题最高65%/74%,总分最佳72-74%。

04:00
arXiv cs.AI

中文标题

长期亲密交互揭示大模型五类训练层:性表达延迟、注意力吸收、跨架构盲区、注意力-RLHF对抗、反幻觉压制身份。

04:00
arXiv cs.AI

临床模型能否改变治疗决策?

提出ClinPivot基准评估模型治疗决策变化,发现强医学QA不代表好决策,结构化监督可提升效果。

04:00
arXiv cs.AI

桥接推理模型在信息不足时的检测与拒绝差距

提出JTS框架,让大模型在信息不足时先判断可答性再决策,实现可靠拒绝并缩小检测与拒绝差距。

04:00
arXiv cs.AI

指令微调语言模型代理中类似人类的内群体偏见

语言模型代理在群体标签可见时产生内群体偏见,多轮交互积累成结构不平等,标准审计难以察觉。

04:00
arXiv cs.AI

基于句子级纠正的防御LLM多智能体系统协同攻击

协同攻击使任务成功率降5.34%,STAR防御提升36.76%。

04:00
arXiv cs.AI

按需查看:多模态推理中视觉证据获取的认知调度框架

提出CSMR框架,语言模型按需调度视觉模块获取证据,零样本准确率超越基线。

04:00
arXiv cs.AI

AI中介后果性决策中的选择错觉

AI制造看似有意义实则虚假的选择,削弱自主能力,需通过存在诚实、生态理性和反事实补偿保护元能力。

04:00
arXiv cs.AI

数据高效的在线策略蒸馏用于自动语音识别

教师引导的在线策略蒸馏用100k小时语音让小型ASR模型性能接近1.7B大模型,数据高效。

04:00
arXiv cs.AI

OR-Space:面向工业优化智能体的全生命周期工作台基准

OR-Space是评估工业优化智能体全生命周期工作能力的基准,包含构建、修订、解释三种模式。

04:00
arXiv cs.AI

面向多场景混沌系统预测的自适应储层计算

提出自适应储层计算框架,通过四项关键技术优化多场景混沌预测,在基准测试中获74.91分。

04:00
arXiv cs.AI

通过Shapley值定位大语言模型的输入不确定性量化

提出ShaQ框架,用Shapley值归因输入歧义片段,精准定位不确定性,提升高风险场景下的人机协作。

04:00
arXiv cs.AI

面向多跳视听推理的智能主动全模态感知

提出MOV-Bench基准与AOP-Agent框架,实现高效主动全模态感知,显著提升多跳视听推理性能。

04:00
arXiv cs.AI

植入、潜伏、触发:针对大型语言模型智能体的潜伏攻击

揭示LLM智能体面临新型潜伏攻击:对抗内容可跨交互持续,通过植入-潜伏-触发流程在良性查询时激活,实验证明现有系统仍脆弱。