436 条条目 · 106 个活跃源
2026年9月3日
22:35
X @svpino

@svpino:我希望所有开放模型提供商都能向这些家伙学习,开始公开训练代码、评估、日志和权重。

希望开放模型提供商公开训练代码、评估和日志;开放权重虽好,开源更佳。

20:56
X @svpino

@svpino:🐐 https://t.co/jb1xkPOUOf

推文仅为山羊表情与链接,无实际文字内容。

19:53
X @svpino

@svpino:这是一个很酷的基准测试,通过视频游戏测试智能体。

用速通游戏评估智能体的规划、行动、学习和长序列决策优化能力。

19:29
X @svpino

GPT-6 Astra 以99.9%得分饱和ARC-AGI-3,并以100%得分饱和ExploitBench。

GPT-6 Astra 在 ARC-AGI-3 得99.9%,在 ExploitBench 得100%,连 Fable 也未达到。

18:57
X @svpino

@svpino:不存在普遍最优模型

不存在普遍最优模型,最佳应用常组合多模型互补,按任务、响应质量、成本、可靠性比较并看组合效果。

17:16
X @svpino

我不喜欢智能体旁听会议(因为不会读它们的笔记),但确实想要它们帮我处理邮件和日程。

愿用AI处理邮件日程,不愿其旁听会议记笔记。

16:27
X @svpino

@svpino: This is how I'd like the Chrome Inspector to work in 2026:

15:52
X @svpino

你知道我们为那些公司“构建上下文”花了多少钱吗?

AI时代,上下文质量是企业最重要的竞争优势;模型相同时,上下文质量决定成败。

15:03
X @svpino

@svpino: Two ways to stay up to date on what's happening with AI and agents:

14:18
X @svpino

@svpino:我和孩子正为此纠结

纠结孩子用AI:既怕他逃避思考,又想让他了解潜能。目标:教他建立模型,判断何时用AI、何时独立思考。

13:26
X @svpino

@svpino:对任何希望看到开放模型成功的人来说,这都意义非凡!

首次见到开放模型发布检查点级日志,每个模型的训练代码、数据预处理、评估和日志均已公开,意义重大。

12:10
X @svpino

@svpino:大量开发者此刻正经历艰难时期。

开发者身份曾系于编码,如今人人能写代码,他们不写代码又是谁?作者持务实态度。