利用图工具提升小语言模型的分子性质预测
利用GNN工具增强提示,使小语言模型分子性质预测准确率提升高达74%。
现代智能体系统中的自我改进:综述
提出基础模型与操作支架耦合框架,形式化自我改进为自诱导更新算子,综述应用与评估,探讨未来方向。
Oracle代理内存:面向长周期AI代理的企业级内存基座
Oracle Agent Memory作为企业内存基座,实现长周期AI代理,在LongMemEval达93.8%准确率,节省10.7倍令牌。
通过世界模型从人类偏好和理由中学习安全智能体行为
利用世界模型和人类偏好理由训练奖励模型,实现安全高效的智能体部署。
CayleyR:通过循环交集解决TopSpin谜题
提出cayleyR包,通过Cayley图循环交集双向搜索求解TopSpin谜题,采用C++和GPU加速实现。
面向交通管理的成本最优基础模型部署组合
提出FMDP混合整数规划问题,证明NP-hard并给出贪心算法,案例显示混合部署成本降低97%。
AI-Native Insurance for Agentic AI: Pricing, Underwriting, and End-to-End Automation
面向自主AI的AI原生保险框架,实现承保定价、合同优化与自动化理赔。
AI建议削弱了人们说“我不知道”的意愿,即便建议有误且准确性受激励
五项实验表明,AI建议即使错误也抑制人们暂停判断,导致回答更多但正确率骤降,信心却翻倍。
Harness手册:让演化的智能体框架可读、可导航、可编辑
提出Harness Handbook自动建立行为到代码映射,辅以BGPD引导,提升智能体框架演化中的行为定位与编辑质量。
LAPO:多轮搜索推理中自我生成过程奖励的留一轮归因法
LAPO以留一轮归因自我生成过程奖励,无需额外模型,在7个问答数据集上平均精确匹配0.326,超越强基线IGPO 0.053。
针对受控智能体的任务转换行为测试
LLM代理在工具可靠度隐式切换时形成固定调用模式,其适应力受工具集呈现方式影响。
真实遥测数据上的根因分析能走多远?
根因分析瓶颈在模型推理能力而非数据缺失,多智能体方法优于现有基线,需模型级改进。
基于工具增强证据的多智能体协作推理用于城市区域画像
提出UrbanAgent框架,用多智能体协作推理与工具增强证据解决跨模态不一致,性能平均提升8.1%。
AIMO可解释性挑战赛
通过模型内部机制区分稳健推理与投机推理,建立数学推理开放鲁棒性基准。
基于大语言模型智能体系统的生物系统常微分方程自动发现
MEDA系统结合大语言模型与符号回归,自动发现生物系统常微分方程,实现知识引导与结构恢复,产生生物可解释模型。
UESF-Bench:统一的具身搜索与跟随基准测试与探究
提出统一具身搜索与跟随基准(UESF-Bench)及SeekFollow-VLA框架,解决先找后跟的挑战,大幅优于基线。
STOCKTAKE:用公平预言机衡量LLM智能体感知与行动间的差距
STOCKTAKE基准区分LLM智能体感知与行动失败,发现感知检测率高但行动技能分低,存在反应不足和过度两种失败。
AI加速端到端框架,助力快速职业提升
提出AI加速的职业提升五阶段框架,获美国会计委员会认证,学员快速通过NVIDIA专家考试。
安全条件增益:双重用途生物学助手的效用-风险前沿测量
引入安全条件增益协议,通过人评效用-风险前沿,发现安全助手降低有害性但非绝对优势。
LessonBench-V1:用于评估AI课程生成代理的基准数据集
含647个STEM课程及3620个学习目标,融合多种教学法,系统评估AI课程生成代理。
中文标题:何时可以从应力强度剖面识别组合载荷?基于SIFBench有限元数据的前向-逆向耦合研究
中文摘要:研究从应力强度剖面识别组合载荷的可识别性,依赖载荷剖面线性独立性,通过稳定性裕度刻画病态程度。
纠缠之墙:激活空间探针作为风险检测器,而非上下文裁决器
激活探针高于95%阻断有害请求,但分类器泛化弱,表现为广义风险检测器而非独立上下文裁决器。
大语言模型在欺诈检测与信任安全工作流中的运行证据缺口
综述发现LLM在欺诈检测中缺乏延迟、成本等运行证据,审核领域证据较充分;提出FORTE框架与部署清单。
SemaDiff:利用生成代码和测试识别语义变更提交
SemaDiff通过生成测试代码比较版本行为,准确识别语义保留提交(76%准确率,语义变更检测100%精确)。
MiMo-V2.5系列全流水线推理优化:将混合SWA效率推向极限
通过KVCache系统优化和RDMA分布式缓存,首次大规模实现混合SWA+MoE+多模态架构的高效生产部署。
面向跨地形高速MPC的通用车辆模型适配
OptCar通过历史条件适配与有限数据微调,在高速MPC中跨地形跟踪误差降低55%,超越基线方法。
WaterMoE:基于专家路由的高保真高效水印
提出WaterMoE,通过专家路由嵌入水印,实现高保真与低开销,速度提升4倍,延迟仅增1%。
日常活动分类需要姿态,而重建则需要运动
分类日常活动主要依靠静态姿态,重建活动则需动态运动信息,TMPs保留了时间动态以生成自然运动。
考虑部署偏移的风险可控N-1热态事故筛选的审计选择性验证
提出在线审计校准阈值方法,保证部署偏移下热过载率不超预算,减少全潮流计算约29%-75%。
自然语言断言的忠实自动形式化
Monty框架通过一致性评分和有效性评分过滤,实现自然语言断言的忠实自动形式化,精确度提升达20%。
通过剪枝实现高效文本到音频生成
对AudioLDM剪枝,最多减少83%参数和39%运算,生成质量保持甚至提升,影响部分声音但微调可恢复。
基于梯度嵌入的贪婪体积最大化方法用于长尾帧级生物声学主动学习
提出BADGE-Greedy-DPP,通过贪婪扩大梯度嵌入体积选批次,在长尾生物声学主动学习中效果最佳。
How Agents Ask for Permission: User Permissions for AI Agents, from Interfaces to Enforcement
覆盖优先,温和分歧:重新思考帧级音频分类中的不匹配优先主动学习
提出分歧加权覆盖的主动学习方法,避免选择相似片段,在帧级音频分类中取得最佳学习曲线面积。
IMMNet:基于模型与数据驱动混合融合的机动目标跟踪
提出IMMNet混合算法,融合模型可解释性与数据驱动学习,显著提升机动目标跟踪性能。
Semantic Anchoring for Robotic Action Representations
Kaleido:利用潜在空间相关性的视频扩散Transformer算法-硬件协同设计
Kaleido通过挖掘潜在空间通道级时空相关性,实现视频扩散Transformer加速,最高5.9倍速与16倍节能。
CAS I:几何编码定理
在对称群中建立几何编码定理,证明对称先验为通用下半可计算半测度。
AI增强的人力资源管理?来自德国公司的启示
德国企业AI应用于HR主要提升效率与合理化,战略潜力与数据治理挑战并存。
部分相关的验证器级联在LLM框架中:凹对数几率、多项式可靠性和盲点上限
部分相关验证器级联中后验对数几率呈凹性,可靠性多项式衰减,存在盲点上限,重复判决可辨识相关性。
动态可验证的多智能体人类自主忠诚循环(DVM-HALL)模型与自主商业中的净人智分数(NHAS)
提出DVM-HALL模型与NHAS指标,整合人类情感、机器效用及可验证执行,解决自主商业中人机对齐问题。
通过能力导向基准与MCTS数据生成推进多模态法官模型
提出十维能力基准M-JudgeBench和MCTS数据框架,训练强法官模型M-Judger。
NeSy-Route:面向遥感中约束路径规划的神经符号基准
提出含自动数据生成与三级评估的NeSy-Route基准,揭示现有多模态大语言模型在感知和规划上的显著缺陷。
基于LLM的定性与定量评估发现常微分方程
提出DoLQ方法,利用多智能体与LLM进行定性定量评估,从数据中发现常微分方程,性能优于现有方法。
从观察到洞察:机理世界模型与自主探索之路
提出机理世界模型范式,以可重用机制为核心,推动AI从预测迈向自主科学发现。
人工智能冲突情境下心智理论的因果模型
提出冲突下心智理论的因果模型,将ToM视为条件激活机制,通过因果路径提升认知准确性,实现资源合理决策。
Koopman驱动的EMG传感握力预测
通过单个sEMG传感器和Koopman算子,实现握力估计与0.5秒预测,误差分别约5.5%和17.9%,算法快速可实时。
面向参数化动作马尔可夫决策过程的知识与梯度引导强化学习
利用知识库剪枝动作与约束参数,结合梯度优化,提升样本效率并提供局部解释,在PAMDP任务中超越基线。
注意差距:针对安卓GUI代理的动作重绑定攻击
跨应用动作重绑定攻击利用观察-动作间隙,零权限劫持安卓GUI代理执行特权操作,成功率100%且免杀。
ELF:一系列无编码器的心电图-语言模型
提出三种无编码器ELM,以更简单架构在两个数据集上比肩或超越先前最优模型。