GPT-6 Astra 对比 GPT-6.1 Sol 对比 Gemini 4 Argon 对比 Claude Fable 5.1:哪款前沿模型适合哪类工作
Astra 擅长电脑操作,Argon 主导法律与金融工作,Sol 在编程智能体上以价格取胜。
谷歌研究将联邦学习迁入TEE:Gboard 现以可外部验证的差分隐私进行训练
谷歌将联邦学习梯度计算移入可信执行环境,访问策略公开可查,Gboard已用于英语和日语下一词预测。
Aleph Alpha 发布 Kolibri:仅 3.46B 激活参数的 78.1B 开源英德混合专家模型
Aleph Alpha发布78.1B英德MoE模型Kolibri,仅激活3.46B参数,支持1M上下文。
DeepSeek Harness v0.2 为开源智能体框架推出官方桌面应用
DeepSeek Harness v0.2发布官方桌面应用,新增插件管理、代码审查与定时任务。
深入解析 NVIDIA IsaacTeleop:从手部与控制器追踪到基于图的重定向引擎驱动机器人动作
IsaacTeleop 用纯 Python 图重定向引擎与 NumPy,将 XR 手部追踪和控制器输入转为机器人指令。
Meta、OpenAI 和 Uber 刚教会 AI 智能体先开口,那何时该保持沉默?
Meta、OpenAI、Uber让AI代理先开口,难点转为何时打断、选何渠道、给何提议。
IBM将Bob引入自托管与气隙环境:无需迁移代码的智能体软件开发
IBM Bob支持本地、私有云及气隙部署,代码不外流,模型自选,并支持Java、IBM Z现代化。
Prime Intellect 推出 Prime Inference:面向前沿开源模型的无服务器与预留推理服务
Prime Intellect 推出 OpenAI 兼容平台 Prime Inference,基于 Blackwell 部署前沿开源模型,GLM-5.3 每用户达 101 tok/s。
微软 AI 发布 MAI-Transcribe-2-Streaming:Artificial Analysis 上排名第一的实时语音转文本模型
微软发布首款实时语音转文字模型,流式榜单居首,词错率2.5%、延迟0.13秒,支持60种语言。
决策AI模型解析:TypeSafe Jev 与 Fastino GLiDE、GLiNER2.5-Decide 及开源竞品对比
决策 AI 模型以校准概率回答类型化问题而非生成文本;TypeSafe Jev 每百万输入 token 仅 0.042 美元、响应 70–500 毫秒,本文解析其原理并对比 GLiDE 等竞品。
英伟达发布 DGX Spark 64GB:面向本地 AI 智能体、微调与推理的 1-PetaFLOP Grace Blackwell 台式机
英伟达推出64GB版DGX Spark,搭载GB10,可双机互联扩至128GB内存,面向本地AI智能体与推理。
Datalab推出OmniExtractBench,修复抽取基准的偏差与不透明问题
借内容行匹配、6种单值判定与空值规则,打造人人可审计的抽取基准。
AWS Strands Labs 发布 Strands Decider 2B:一款约 115 毫秒即可选出选项的开源决策模型
基于Qwen3.5-2B的开源决策模型,单次前向输出选项与置信概率,中位延迟115毫秒。
Genesis AI 发布 Nyx、Quadrants 及 Genesis World 1.0 物理平台,用于可扩展机器人基础模型评估
Genesis AI 发布四组件仿真平台,模拟与现实相关性达0.9,评估时间从超200小时降至0.5小时以下。
Hermes Agent推出MCP工具搜索:Anthropic评估显示Opus 4准确率提升49%至74%
Nous Research通过BM25渐进式披露修复MCP上下文膨胀,新增工具搜索功能。
如何使用AgentTrove:在Python中流式处理170万条智能体轨迹并构建干净的ShareGPT SFT数据集
最大开源智能体交互数据集AgentTrove,170万行,本教程演示Python流式处理与构建SFT微调数据集。
NVIDIA 推出 X-Token:投影引导的跨分词器知识蒸馏,性能在 Llama-3.2-1B 上平均领先 GOLD 达 3.82 分
NVIDIA X-Token修复GOLD两大结构缺陷,将GSM8k准确率从2.56提升至15.54。
StepFun发布Step 3.7 Flash:一款面向编码代理与搜索工作流的198B参数MoE视觉语言模型
StepFun发布198B MoE模型Step 3.7 Flash,具备原生视觉、256k上下文及顾问模式。
mKernel:一个用于GPU驱动通信的多GPU、多节点融合内核库
伯克利UCCL团队发布mKernel,将节点内NVLink、节点间RDMA和密集计算融合为单一持久CUDA内核。
Hexo Labs开源SIA:一种同时更新脚手架和模型权重的自改进智能体
Hexo Labs开源SIA,反馈代理读取轨迹后重写脚手架或更新权重,两者结合在多项基准上超越仅迭代脚手架。
如何设计一个完整的Ansible自动化实验环境(含Playbooks、清单、角色、Vault、动态清单及自定义模块)
在Colab或Linux中端到端构建Ansible自动化实验环境,涵盖安装、配置、静态/动态清单及变量优先级等核心概念。
Liquid AI 发布 LFM2.5-8B-A1B:一款设备端 MoE 模型,总参数 83 亿,激活参数 15 亿
该模型激活15亿参数,支持128K上下文、推理及工具调用,可在消费级硬件上运行。
Anthropic 发布 Claude Opus 4.8,同时推出动态工作流和更便宜的快速模式,工作流最多支持 1000 个子代理
Anthropic 推出 Claude Opus 4.8,为 Claude Code 新增动态工作流和低价快速模式,处于研究预览。
Perplexity AI 开源 Unigram 分词器,p50 延迟比 Hugging Face tokenizers 快 5 倍
Perplexity AI 开源重写 Unigram 分词器,降低重排器延迟,生产 CPU 利用率减少 5-6 倍。
pgvector驱动的语义、混合、稀疏与量化向量搜索系统编码指南
在Colab中搭建pgvector环境,用PostgreSQL实现语义、混合、稀疏和量化向量搜索。
Sakana AI 提出 DiffusionBlocks:一种将残差网络转化为独立可训练去噪模块的逐块训练框架
DiffusionBlocks 将层更新视为逆向扩散去噪步骤,实现残差网络的独立可训练块。
NVIDIA发布Polar:面向Codex、Claude Code和Qwen Code的GRPO训练忠实令牌展开框架
NVIDIA推出Polar框架,通过API代理捕获令牌级交互,用GRPO训练使SWE-Bench通过率最高提升22.6点。
了解EAGLE 3.1:修复大语言模型推理中注意力漂移的投机解码算法
EAGLE 3.1修复生产环境投机解码不稳定,由EAGLE团队、vLLM和TorchSpec联合发布。
MEMO:一种模块化框架,无需修改LLM参数即可训练专属记忆模型学习新知识
新加坡国立大学、MIT等提出MEMO框架,将新知识编码到可训练记忆模型,不修改LLM参数。
使用ZeroEntropy Zerank-2重排序器设计高精度检索-重排序流水线
教程使用Zerank-2重排序器构建两阶段检索流水线,提升检索精度。
Stability AI发布Stable Audio 3:用于音频生成与编辑的快速潜在扩散模型系列
Stability AI开源小/中模型,44.1kHz立体声,BBC音效基准FAD仅0.369。
介绍 OmniVoice Studio:ElevenLabs 的本地开源替代方案
OmniVoice Studio 是本地开源工具,支持语音克隆、视频配音、实时听写,覆盖646种语言,无需云服务即可集成AI助手。
利用Open-MM-RL、视觉语言提示、奖励评分与GRPO导出设计完整多模态RLVR管道
基于Open-MM-RL数据集,构建多模态推理与可验证奖励强化学习管道,涵盖数据加载、分析及轻量级奖励函数设计。
Together AI 开源 OSCAR:面向长上下文大模型服务的注意力感知型 2-bit KV 缓存量化系统
OSCAR 通过注意力感知协方差离线旋转实现 2-bit KV 缓存量化,在长上下文下内存减少 8 倍、解码加速 3 倍,精度损失极小。
逐步指南:使用NVIDIA FLARE在非IID CIFAR-10上构建并比较FedAvg与FedProx联邦学习
本教程用NVIDIA FLARE在非IID CIFAR-10上比较FedAvg与FedProx,Dirichlet分布模拟标签不平衡。
2026年AI智能体与MCP服务器最佳身份认证平台
MCP月下载量超9700万,AI代理进入生产,身份认证成关键。本指南评估八大平台,聚焦规范合规性、企业身份深度等。
WorkOS 发布 auth.md:基于 OAuth 标准的开放代理注册协议
auth.md 通过 Markdown 文件让 AI 代理无需人工填表即可注册,获取用户凭据。
中文标题
构建Langfuse可观测性与评估管道,实现追踪、提示管理、评分及实验,支持真实/模拟LLM。
StepFun发布StepAudio 2.5 Realtime:端到端语音模型,含角色扮演RLHF与副语言理解
StepAudio 2.5 Realtime:端到端实时语音模型,支持角色定制与副语言理解,基准测试排名第一。
微软研究院发布Webwright:终端原生Web代理框架,Odysseys得分60.1%,较基础GPT-5.4的33.5%大幅提升
Webwright是终端原生浏览器代理框架,用Playwright脚本取代点击追踪,在Odysseys上达60.1%,创开源最高分。
NVIDIA AI 发布 Gated DeltaNet-2:在 Delta 规则中解耦擦除与写入的线性注意力层
NVIDIA推出Gated DeltaNet-2,将Delta规则中的擦写门解耦为通道级,在语言建模等任务上超越Mamba等模型。
腾讯开源TencentDB Agent Memory:AI智能体的四层本地记忆流水线
腾讯开源四层本地记忆系统,Token减少61.38%,通过率提升51.52%,角色记忆准确率达76%。
使用命令、代理、模式和会话记忆构建SuperClaude框架工作流
本教程使用SuperClaude框架在Anthropic API之上构建包含命令、代理、模式和会话记忆的高级工作流。
Nous Research发布对比神经元归因(CNA):无需SAE训练或权重修改的稀疏MLP电路引导
CNA方法无需训练或修改权重,即可识别消融稀疏MLP电路来引导LLM行为。
Perplexity 开源 Bumblebee:面向开发者端点的只读供应链扫描器
Perplexity开源Bumblebee,用于macOS和Linux的只读供应链扫描器,无需运行代码即可检测包和扩展风险。
逐步编码教程:实现GBrain——Y Combinator的Garry Tan为AI智能体构建的自连线记忆层
Y Combinator的Garry Tan开发了开源记忆层GBrain,通过Markdown知识图谱和正则推理解决AI记忆问题,本教程20分钟内完成安装与连接。
微软发布Fara1.5:一系列浏览器计算机使用智能体(4B/9B/27B),在Online-Mind2Web上超越OpenAI Operator和Gemini 2.5 Computer Use
微软推出Fara1.5系列浏览器智能体,27B版以72%得分超越OpenAI Operator和Gemini 2.5。
使用OpenMythos构建循环深度Transformer,用于MLA、GQA、稀疏MoE和循环缩放推理
本教程用OpenMythos在Colab构建循环深度Transformer,对比MLA/GQA参数并检测循环注入矩阵稳定性。