全部OpenAIHugging FaceArXiv AIGoogle AIVentureBeat AIMarkTechPostPragmatic EngineerThe GradientOne Useful ThingCrunchbase NewsTechCrunchGoogle DeepMindMicrosoft ResearchLlamaIndex BlogarXiv cs.AIarXiv cs.LGarXiv cs.CLarXiv cs.CVNature Machine IntelligenceLilian WengAndrej KarpathySebastian RuderBAIR BlogAgile Lab EngineeringGoogle AI BlogMeta NewsroomMIT Tech Review AITechCrunch AIWiredFull-Stack AI EngineerAgentplexa16zSequoia CapitalY CombinatorElad GilTomasz TunguzNot BoringThe GeneralistSimon WillisonSimon Willison NewsletterLatent SpaceImport AIInterconnectsHamel HusainDAIR.AIEnterprise AI GovernanceStratecherySemiAnalysisBenedict EvansX @OpenAIX @claudeaiX @AnthropicAIX @karpathyX @samaX @demishassabisX @DarioAmodeiX @elonmuskX @miramuratiX @ilyasutX @gdbX @AravSrinivasX @arthurmenschX @ClementDelangueX @alexandr_wangX @mustafasuleymanX @ylecunX @geoffreyhintonX @AndrewYNgX @fcholletX @polynoamialX @_jasonweiX @DrJimFanX @rasbtX @lilianwengX @OriolVinyalsMLX @tri_daoX @percyliangX @ch402X @janleikeX @swyxX @simonwX @jeremyphowardX @OfficialLoganKX @svpinoX @SuhailX @emollickX @_akhaliqX @natolambertX @rowancheungX @bilawalsidhuX @Francis_YAO_X @ShunyuYao14X @tqchenmlX @haozhangmlX @GoogleDeepMindX @huggingfaceX @MistralAIX @perplexity_aiX @NVIDIAAIX @xaiX @victor207755822X @deepseek_aiX @bchernyX @Alibaba_QwenX @Kimi_MoonshotX @dotey
47 条条目 · 106 个活跃源
2026年9月29日
17:57
X @polynoamial
@polynoamial:我很高兴@OpenAI以这种方式展示模型评估。我们应当以成本为函数来衡量智能。
赞同OpenAI以成本为维度展示模型评估,主张智能应按成本衡量。
17:45
X @polynoamial
@polynoamial:周末测试了下dots,它居然帮我每年省下约500美元的订阅费。最惊艳的是它还能接通客服,替我全程搞定短信对话。
周末测试dots,发现它每年帮我省约500美元订阅费;最惊艳的是它能接通客服,代我完成整段短信对话。
2026年9月8日
18:46
X @polynoamial
@polynoamial:非常遗憾看到Levent在抄袭指控上变本加厉。我希望@AnthropicAI的朋友们能在内部站出来。现在真相应该已经清楚了。
遗憾看到Levent变本加厉坚持抄袭指控,盼Anthropic内部能挺身而出,真相应已清楚。
17:47
X @polynoamial
@polynoamial:我理解,看到如今的LLM,人们可能认为我们唯有使用Levent/Tristan的提示才能实现NS。但我希望这张图传达出所用模型远胜当今LLM。没人查看那些提示,那样太疯狂了。https://t.co/hdAQbP486X
我理解有人以为只有用特定提示才能实现NS,但所用模型远强于当今LLM,没人查看那些提示。
17:25
X @polynoamial
@polynoamial:是的,这一结果耗资数百万美元。
此结果耗资数百万美元,但成本骤降:o3曾50万美元获87.5%,Astra约20美元更高;2025巨算夺IMO金牌,2026人人可及。
17:23
X @polynoamial
@polynoamial:在看见 AI 超越你所热爱的领域之前,你很难“感知到 AGI”。本周,OpenAI 的许多数学家和物理学家经历了他们的“李世石时刻”——模型只花几分钟就解开了他们钻研多年的难题。
AI几分钟解决专家多年未解的开放问题,令OpenAI数学家物理学家真切体会到AGI。
07:27
X @polynoamial
强烈同意。实验室间虽有竞争,但面对未来挑战,学会合作至关重要。
强烈赞同。实验室间虽有竞争,但面对未来,合作至关重要。
06:47
X @polynoamial
@polynoamial:塞布是个心地善良、用意极好的伙伴,很开心与他及众人为期一周的合作顺利,但遗憾未能如愿完成。明日详谈。
塞布善良真诚,一周合作虽顺利却未竟全功,既喜又憾,详情明日再述。
2026年8月1日
08:32
X @polynoamial
@polynoamial:在Sol API价格下,生成这10项突破性成果的全部证明总成本不到2000美元。我们期待科学家和研究人员能用我们即将推出的Astra模型创造些什么!
生成10项突破证明总成本不到2000美元,期待Astra模型助力科研创新。
08:17
X @polynoamial
@polynoamial:OpenAI下一代模型家族Astra的内部版本,解决了数学、量子复杂性和理论计算机科学领域的10个重大开放问题。
Astra内部版解决数学、量子复杂性及理论计算机科学10个重大开放问题,被视为科学推理的重大进步。
2026年7月20日
17:42
X @polynoamial
@polynoamial:长期运行的模型能解决艰难的开放式问题,但其持久性会带来短周期评估未能发现的安全风险
长期模型解难题,但持久性带来安全风险,短评估有遗漏
2026年7月10日
18:26
X @polynoamial
@polynoamial: 更多测试时计算带来更强智能,但延迟成瓶颈(从秒至周)
测试时计算提升智能但延迟成瓶颈;GPT-5.6并行扩展,将50年难题证明从整天缩至一小时。
18:19
X @polynoamial
@polynoamial: GPT-5.6 Sol Ultra 证明了50年历史的数学猜想,模型已公开发布,期待科研用途
GPT-5.6 Sol Ultra 破解50年数学猜想,模型公开,推动科研。
2026年6月18日
16:50
X @polynoamial
@polynoamial: 当我们宣布@OpenAI o1时,其他实验室的研究人员告诉我,我们犯了战略错误,应该保密以加速自身的进展并拉开与竞争对手的差距。这些研究让我确信我们做出了正确的选择。
研究者认为OpenAI公开o1是战略错误,但相信公开是正确的选择。
16:14
X @polynoamial
@polynoamial: Kevin是最优秀的AI记者之一,他亲自使用前沿AI并深入理解其能力与局限,令人期待他的下一步。
Kevin是顶尖AI记者,亲测前沿AI并深刻理解其能力与局限,未来可期。
15:58
X @polynoamial
@polynoamial:我想不到比@deanwball更适合塑造前沿AI政策的人。他清楚AI走向,期待在@OpenAI与他共事!
@deanwball是制定前沿AI政策的最佳人选,期待与他共事。
00:21
X @polynoamial
@polynoamial: 很高兴OpenAI有更多Noam,但特别欢迎@NoamShazeer!
欢迎Noam Shazeer加入OpenAI,为团队增添更多Noam而兴奋。
2026年6月9日
15:35
X @polynoamial
@polynoamial: We've known about LLM test-time compute scaling since @OpenAI o1.
04:57
X @polynoamial
@polynoamial:链接
该推文分享了一个链接,内容未提供具体信息。
2026年5月12日
17:42
X @polynoamial
@polynoamial: 我很喜欢看到新评估分数这么低。当GPT-5.5发布时,几乎所有基准测试得分都超过50%。是时候淘汰GQPA这类评估,引入新评估了。
新评估分数低揭示旧评测太简单,应淘汰GQPA等,推出新评估。
01:34
X @polynoamial
@polynoamial:趣闻:致命错误最初是由@OpenAI的GPT-5.5标记的
致命错误最初由OpenAI的GPT-5.5标记。