智能体思考得更深吗?顺序规划中逐层动力学的机制研究
通过逐层分析,发现智能体推理随任务展开动态利用深层,存在早期构建与后期精炼的深度分配模式。
DiagramRAG:用于检索科学图表以生成图形的轻量级框架
DiagramRAG用知识图谱表示图表,检索与草图语义拓扑匹配的参考图,实现高效生成(F1 0.848,延迟35.48秒)
从说话到唱歌:音视频深度伪造检测的新挑战
针对唱歌场景域偏移,提出文本引导音视频伪造检测框架T-AVFD,学习通用真实性模式,提升检测鲁棒性。
过度思考的形态:长程推理轨迹中的回溯爆发
研究长推理轨迹中自我修正与无效修订的区别:早期修复更准确,错误轨迹中重度回溯聚集在后,突发感知过滤优于固定长度过滤。
STAB:规范驱动的算法瓶颈测试
STAB通过约束饱和与对抗场景注入,从问题规范生成测试用例暴露算法瓶颈,开源模型提升23%,闭源提升14%。
奖励偏差替代:单轴偏差缓解措施重新引导优化压力
单轴缓解奖励偏差可能导致偏差替代,优化压力转移至相关代理,需结合策略分布评估消除测量-优化差距。
Clark哈希:用于神经嵌入的无状态稀疏Johnson-Lindenstrauss量化
Clark Hash将384维嵌入压缩至48字节(32倍),无需训练,评估显示高相关性。
长时程空间生物学的可验证基准测试
提出SpatialBench-Long基准,测试AI从原始空间数据推导科学结论,覆盖多种数据,成功率仅11.1%。
BlazeEdit:基于图像到图像扩散模型的移动设备通用图像编辑
1.95亿参数轻量扩散模型,290ms实现移动端多任务图像编辑,保护隐私。
CIVIC:面向高效视觉语言模型的端到端序列紧凑性
CIVIC通过端到端紧凑序列表示,避免非连续内存访问,将KV缓存缩至1/3,推理加速且精度不减。
MACReD:一种用于反应图解解析的多智能体协作推理框架
MACReD通过层次化多智能体协作与多图融合机制,实现反应图解解析,在基准测试中取得最优性能。
Examining Agents' Bias Amplification versus Suppression in Multi-Agent Systems
BuddyBench:隐私约束下的儿科社交沟通个性化多任务基准
隐私约束多任务基准BuddyBench,整合学习轨迹与临床数据,支持儿科社交沟通个性化评估与预测。
牙科锥束CT重建的梯度步进即插即用模型
训练梯度步进去噪先验,集成即插即用算法,减少牙科锥束CT重建中的光子噪声。
解构空间复杂性:面向LLM空间推理的层次分解
提出层次分解与M-GRPO优化,显著提升LLM空间推理性能,达最先进水平。
OccuReward:基于大语言模型的以 occupant 为中心的奖励塑造方法,用于实现电网互动楼宇中的人口公平性
提出OccuReward框架,通过LLM迭代优化奖励函数,提升热舒适公平性,使老年女性满意度提高567%,同时节能3.2%。
熵分布作为生成模型中幻觉的指纹
基于熵分布统计特性,提出单次前向传递的校准熵评分,高效检测幻觉,性能媲美多采样方法。
中文标题:AI,你来掌舵:人机协作问答中的委托与信任驱动因素
中文摘要:人机协作中,人类常过度或不足依赖AI,导致错误。研究建议通过校准置信度、证据解释和信任校准机制提升协作效果。
双人零和博弈的全局策略空间响应预言机
提出全局PSRO方法,通过最小化种群可利用性指导策略扩展,以更少迭代逼近纳什均衡。
大语言模型能从文本中构建世界模型吗?空间推理的多语言诊断
提出多语言空间推理基准MentalMap,发现LLMs普遍存在L3推理悬崖,归因于纯文本工作记忆限制。
ResearchLoop:面向AI辅助研究的证据门控控制平面
证据门控控制平面ResearchLoop持久化研究状态,确保AI辅助论文主张可审计。
解释比单纯预测更难:评估多模态大模型作为ICL视觉分类器的概念可解释性
评估显示,MLLMs在ICL中解释比预测更难,形式化概念解释降低准确率,但成功解释与正确预测强相关。
学习何时优化:从专家GPU内核中提取验证的优化技能
KLineage反向遍历专家内核,学习何时优化,生成验证技能,提升LLM内核质量和效率。
REED:面向跨域语言隐写分析的后训练表示编辑
提出后训练表示编辑方法,通过域偏移与覆盖-隐写方向编辑,实现高F1跨域隐写分析,无需修改架构。
提示码本:面向语言模型指令优化的离散组合优化
提出提示码本(PCO),将提示优化转为离散组合学习,实现实例级路由,性能提升超30%,提示长度压缩14倍。
From Fact Overwriting to Knowledge Evolution: Causal Editing via On-Policy Self-Distillation
Better Accuracies, Worse Reasoning: A Step-Level Audit of Medical Chain-of-Thought Distillation
GONDOR 来救援:低内存下的满意规划
GONDOR通过压缩搜索树保留稀疏锚点,在严格内存限制下继续搜索,显著提升低内存规划覆盖率。
CyberJurors:面向电商纠纷裁决的多智能体模拟任务
推出电商纠纷裁决任务与基准,多智能体CyberJurors通过推理链与共识模拟,超越SOTA,贴近真实陪审员投票。
从论文到基准:基于智能体与框架的机器健康智能中未充分指定方法的重现
提出智能体框架方法重现PHM论文,将未充分指定方法转化为可比较基准,经16篇论文验证。
HRBench:混合推理大语言模型中思维模式切换策略的基准测试与理解
HRBench提出统一框架,系统评估混合推理LLM中12种切换策略(3策略×4训练),揭示token-准确性权衡。
DenoiseRL:自举推理模型从噪声前缀中恢复
DenoiseRL从错误推理中恢复优化,无需外部监督,提升推理性能与训练效率。
BrickAnything:基于几何条件的可构建砖块生成与结构感知标记化
提出BrickAnything框架,用点云和结构感知树标记化生成可构建砖结构,通过偏好对齐、约束解码与自适应回滚提升稳定性和保真度。
约束获取亟需更优质的基准测试
为提升约束获取研究的可重复性与可比性,MPMMine基准套件以开放格式提供多模型、实例及解,弥补现有基准不足。
面向科学的智能体AI实验
提出两个自主AI框架,通过混合架构自动化科学数据采集与讲座报告生成,克服当前系统上下文限制。
你的智能体也在老化:面向部署系统的智能体生命周期工程
AgingBench揭示智能体部署后存在四种老化机制,需进行生命周期评估与阶段靶向修复,而非仅关注初始性能。
OmniToM:通过显式信念建模对LLM心智理论进行基准测试
OmniToM基准通过显式信念建模评估LLM心智理论,揭示当前模型存在角色特定信念追踪瓶颈。
利用局部动态规律性实现离线分层RL中可复用技能
对齐全局上下文与所需动作序列,学习技能复用位置,CARL算法实现技能聚类并提升下游性能。
幻觉检测的自动层选择
提出无需训练的FEPoID法自动选择最优中间层,结合截断策略,有效提升大模型幻觉检测性能。
推理、代码,还是两者兼有?大型语言模型如何处理数学问题的变体
研究对比三种方法发现,代码执行(PAL/SBSC)在数学问题变体上的鲁棒性未优于纯推理(CoT),差异不显著。
MiniMax-M2系列:小激活释放最大现实智能
M2系列MoE模型,总参数2299亿,激活98亿,通过代理驱动数据管道、Forge强化学习系统和自我进化,在编码、搜索等任务上达到前沿水平。
管理大语言模型生成虚拟实验室规划中程序性知识的不确定性
提出框架,用结构化表示和状态转换样本减少LLM生成步骤的不确定性,提取规则并修复步骤。
FAST-GOAL:快速高效的全局-局部对象对齐学习
提出FAST-GOAL微调方法,通过全局-局部对齐和高效匹配,增强CLIP处理长文本的能力。
MobileExplorer:在线探索加速移动GUI代理本地推理
MobileExplorer通过在线探索加速移动GUI代理本地推理,减少23%推理步骤和延迟,提升5%成功率。
MedGuideX:将可执行指南的决策逻辑内化至大语言模型用于临床推理
MedGuideX将临床指南转化为可执行决策逻辑生成训练数据,临床推理准确率提升10.28%,推理更忠实清晰。
警惕工具故障:实现医疗代理的协同工具增益
提出基于GRPO的强化学习框架,通过概率风险最小化和分歧感知协同,提升医疗代理在工具故障下的实例级选择鲁棒性。
完成度与最优性:长视界累积损伤问题中的策略梯度
识别策略梯度在长视界累积损伤中的两种正交失败模式(完成与最优性),提出分解方法并验证四个预测。
能力不是关键:大语言模型代理层级间的控制敏感度呈非单调性
432次实验表明,控制复杂度与模型能力非单调反比,严格控制在推理模型上表现最佳,敏感度取决模型类型。
LiveK12Bench: 大型多模态模型是否真正征服了高中水平的考试?
LiveK12Bench动态基准评估多模态模型,实验显示其在真实考试中性能大幅下降,暴露视觉布局敏感性等缺陷。
关于因子图中交换因子检测的充要条件
现有算法误将必要条件当充分条件,本文修正定理并提出正确高效算法。