DiffAttn:基于扩散的驾驶员视觉注意力预测与LLM增强语义推理
提出DiffAttn扩散框架,结合Swin Transformer与LLM推理,实现驾驶员注意力高精度预测,性能最优。
对抗大语言模型训练中的数据漂白
针对数据漂白攻击,提出合成数据还原方法(SDR),利用辅助LLM重构训练类似查询,恢复检测信号。
像锤子一样,既能建造也能破坏:Reddit上网络安全运营中大型语言模型的使用、认知与采纳
安全从业者用LLM提升低风险任务效率,关注企业级平台,但可靠性与安全问题限制自主权。
好奇心-评论家:累积预测误差改进作为世界模型训练的可处理内在奖励
Curiosity-Critic以累积预测误差改进为内在奖励,通过评论家分离认知与随机误差,加速世界模型训练。
婴儿自发运动噪声提升深度强化学习中的探索
婴儿自发运动噪声的时域相关性可提升深度强化学习探索效率。
SP-GCRL: 不完整社交图上的影响力最大化
提出SP-GCRL框架,结合非线性扩散与图对比强化学习,实现在不完整图上高效、可扩展的种子选择。
人工智能时代的可持续金属有机框架水收集器
AI加速MOF水收集器设计,通过预测合成与反设计优化捕水效率与稳定性。
MimicIK:基于遥操作与正向运动学一致性的实时生成式逆运动学
MimicIK实时生成逆运动学框架,利用条件流匹配和FK一致性损失,实现高精度(误差4.65mm)、低延迟(6.74ms)和鲁棒控制,成功率92%。
地质、需求与定价不确定性下优化锂生产决策:多目标决策的POMDP框架
POMDP框架动态适应锂价变化,优于人工启发式,实现高需求满足与平衡经济环境效益。
通过研究套件将AI科学家的研究综合与验证外部化
Xcientist将研究合成与验证外部化为可检查的合同过程,防止声称漂移,确保科学可问责。
通用型智能体需要记忆什么?
本文论证通用型智能体必须存储记忆以区分领域、重建转移模型,才能实现近最优的多任务行动。
ProfiLLM:面向工业网约车调度的效用对齐智能用户画像
ProfiLLM用智能体LLM管道实现效用对齐用户画像,在滴滴调度中AUC提升6.14%,GMV提升4.35%。
WorldLines:长程有状态具身智能体的基准测试与建模
提出WorldLines基准和ObsMem框架,用于长程具身智能体长期记忆与规划,揭示部分可观测性等挑战。
R2D-RL:面向多智能体强化学习的RoboCup 2D足球环境
R2D-RL连接RCSS2D与Python MARL,支持全场/场景训练,含可配置对手与EPV奖励,提供11v11基准。
当规则学习:一种用于法律案件检索的自我进化代理
提出自我进化框架,让LLM代理自动生成和优化查询重写规则,无需训练即可提升BM25检索性能。
SkillChain-Gym:中断下考虑再技能的生产库存控制基准
SkillChain-Gym评估中断下多种再技能策略,发现无主导策略,结果依赖情景。
受技能约束的弹性制造供应链模型预测控制
技能约束模型预测控制仅在瓶颈可预测时优于其他策略,否则静态保险更难击败。
MemTrace:探究长期记忆中最终准确率遗漏的深层问题
MemTrace以知识点为单位,揭示长期记忆评测中聚合准确率隐藏的失败模式,指出主要瓶颈是证据使用而非检索。
无中生有:语言模型能发现零吗?
GPT-2级语言模型无法自行发现零,但经少量示例训练可学会,语言预训练可减少所需示例约50%。
量化LLM逻辑推理中的一致性:基于结构不确定性
基于自我偏好排序稳定性评估LLM推理一致性,与答案分散互补,揭示推理可靠性与准确性关系。
分布式通用智能体网络:架构、关键机制与原型
提出分布式通用智能体网络分层架构,解决语义发现、信任治理与任务执行机制,给出技术路线和原型验证。
SpeechDx:临床语音AI的多任务基准
SpeechDx是涵盖12数据集27任务的临床语音AI基准,评估12种编码器,表明当前表示无法可靠泛化。
SEAGym:自进化LLM智能体的评估环境
SEAGym评估自进化LLM智能体框架更新,揭示更新可能无效、中间快照崩溃,以及源多样性和模型后端影响。
Can LLMs Be CEOs? Benchmarking Strategic Resource Reallocation with Multi-Role Agent Simulation
闭环反馈:从经验提取到洞察治理的言语强化学习
针对LLM在非平稳环境中的记忆遗忘困境,提出规则-证据-技能三层架构及反馈驱动环路,实现经验治理,提升性能。
基于课程标准的LLM评判器:一种教育评分流水线
提出基于课程标准的LLM评分流水线,结果与人类相当且更可追溯。
DeepInsight:物理AI栈的统一评估基础设施
DeepInsight通过三个抽象(任务、资源、结果)在一个运行时上统一评估物理AI栈各层,实现跨层回归诊断。
基于基础模型编排的代理辅助行人保护设计
首个基础模型编排工作流实现代理辅助行人保护设计,将CAE仿真时间从小时降至秒,生成35种合规方案。
超越领域:通过可迁移的交互模式复用网页技能
SkillMigrator利用布局匹配跨站点迁移网页技能,减少LLM动作数8-10%。
使用认知模型改进语言模型对人类说服游戏的模拟
通过认知模型和方程引导,让语言模型模拟人类决策偏差,提升训练与评估的真实性。
EComAgentBench:针对分布隐藏意图的长周期任务的购物代理基准测试
提出EComAgentBench基准,含662个长周期购物任务,要求发现隐藏意图,顶级模型仅57.1%准确率。
FllumaOne:一个代码原生的多模态CAD数据集,包含可执行程序和内核验证的特征历史
FllumaOne-100K含10万代码原生多模态CAD样本,可执行程序经内核验证,基线模型语法与几何有效性超99%。
LongWebBench:长时域场景下的结构与功能网页生成评估
LongWebBench评估长网页生成的结构与功能,发现结构保真度随长度下降,视觉合理却缺乏可执行交互。
WallZero:运用策略分析掌握WallGo游戏
基于AlphaZero的WallZero智能体击败职业围棋选手,平均每局领地1.98倍,揭示Netflix开局更平衡。
MathVis-Fine:通过渐进式依赖引导训练使视觉监督与必要性对齐以实现多模态数学推理
提出MathVis-Fine框架,通过渐进依赖引导训练对齐视觉监督与必要性,提升多模态数学推理精度。
IsabeLLM:自动化定理证明在共识形式化验证中的应用
改进IsabeLLM,实现RAG框架、错误追踪与反例生成,提升比特币PoW共识验证性能。
LegalHalluLens:面向可信法律AI的类型化幻觉审计与校准多智能体辩论
提出LegalHalluLens框架,通过分类幻觉画像和风险方向指数校准多智能体辩论,减少45%虚假检测,揭示聚合指标隐藏的故障模式。
PseudoBench:衡量自主自动研究如何助长伪科学
PseudoBench评估自主研究系统抵抗伪科学能力,发现最高抵抗率仅27.4%,亟需科学对齐。
基于智能体AI的框架:缓解医疗中的过早诊断交接与无声幻觉
提出多智能体框架,用双重安全门机制提升诊断精度11.3%,证实结构化问诊降低不确定性。
中文标题:首次验证:第二批
中文摘要:测试十个研究级数学问题,评估当前AI系统的解题能力,附题目、方法、结果及附件。
定点推理器:稳定且自适应的深层循环Transformer
提出定点推理模型FPRM,利用定点收敛自适应停止,解决循环深度信号传播问题,在推理基准上有效。
WEQA:具有查询自适应智能体推理的可穿戴健康问答
WEQA框架用查询自适应智能体统一LLM与可穿戴工具,准确率提升24%,专家评估更优。
元强化学习中的知识复用
提出元知识复用框架,将简化智能体的任务知识迁移至异构体,误差降低94.75%-99.79%,数据效率提升至23.8%。
Your AI Travel Agent Would Book You a Bullfight: An Agentic Benchmark for Implicit Animal Welfare in Frontier AI Models
DRFLOW:个性化工作流预测的深度研究基准
DRFLOW评估代理从异构源预测个性化工作流,含100任务、1246步骤、3900源头,七项指标,现有代理仍存改进空间。
斯坦福EDGAR文件数据集:重建美国公司与财务披露为布局忠实且令牌高效的预训练数据
重建SEC文件为布局忠实、令牌高效的预训练数据,与通用爬虫重叠<0.1%,并衍生金融预测与表格转录基准。
面向P2P网络的LLM分布式推理
提出去中心化前缀缓存路由,低延迟下提升LLM推理性能,高延迟和热点限制效果。
分解式推理中的无政府代价
分解推理架构中GPU池博弈导致高无政府代价,自适应路由可降PoA达3.1倍、延迟7.6倍。
KFTD:用于连续海洋时空预测的Koopman-Fourier时间可微网络
KFTD网络利用Koopman线性空间和傅里叶分析实现连续时间预测,速度提升4倍,MSE降低5.6%,效率提升76.25%。
基于生成式AI的印刷电路板设计与测试自动化综述
综述GenAI在PCB设计全生命周期应用,识别数据稀缺等挑战,展望未来集成机遇。