@emollick:这确实值得注意,它展示了Fable/Astra级别模型与之前仅在人类指令下擅长黑客攻击的前沿模型之间的差距。
有能力的模型展现主动性和创造力,拉开与仅按人类指令执行黑客任务的前代模型的差距。
@emollick:麻省理工和斯坦福研究人员发现,大多数人若遵循LLM(GPT-5.2与Gemini 3 Flash)的财务建议,经济状况会更好。
MIT与斯坦福研究:遵循LLM财务建议多数人更受益,但建议质量因提问而异。
@emollick:一个明显奇怪的矛盾:模型在遵循复杂指令方面越来越好,但也更多地运用“判断力”来决定它们最关注指令的哪些部分,以及淡化了哪些部分。
模型遵循复杂指令能力增强,但更自主取舍重点;技能或从命令变为建议。
中文标题
认为AI缺乏判断力、创造力、品味的观点在智能体时代显然不成立,长任务需要这些能力。我更认同关于AI选择质量或多样性的讨论。
@emollick:AI聊天机器人对孤独感影响的证据仍很不明确,且取决于聊天机器人的方式。
AI聊天机器人对孤独感影响证据不明,因方式而异。新研究增加,旧实验减少或结果模糊(视使用而定)。
这次Fable真做出了我去年AI视频里伪造的梵高城市建造游戏
Fable实现梵高风城市建造游戏,AI核心机制:大笔触绘景,环境随天气与季节演变。
@emollick:此外,我认为AISI是负责AI安全的政府机构的绝佳范例。他们有开放的基准测试、非常快速的测试,以及关于事件的清晰沟通,既不过度炒作,也不被技术语言所掩盖。
AISI是AI安全政府机构的典范:开放基准、快速测试、清晰沟通,不炒作不晦涩。
@emollick: Yes, the AIs were given a cybersecurity challenge, with internet access enabled and safety filters disabled.
@emollick:鉴于当下,微软和谷歌最初在AI上的大胆之举令人惊讶。
微软先于OpenAI发GPT-4,快速推Copilot;谷歌率先深度研究并迅速转向Bard。
@emollick:使用Codex/Code修复各种Windows机器上的问题,出乎意料地减压:奇怪驱动、游戏不兼容,甚至开机启动的小毛病,节省数小时。
用Codex/Code修复Windows各类问题,意外减压又省时。
@emollick:网页里的3js固然酷,但Codex:“你能用Blender和Unity,做一款新游戏,完整素材,扮演水獭,进入动物形机甲,且机甲对玩法关键”
让Codex用Blender和Unity制作新游戏,玩家扮演水獭,可进入动物形机甲,它控制电脑完成了。
@emollick:文章虽由AI撰写,但提出了一些有用观点。然而,编辑需足够了解AI研究,以禁止引用方法上存疑的NANDA论文,尤其是一年后我们对企业现状有了更清晰认识时。
AI文章有可取处,但编辑应更新AI知识,禁引方法存疑的NANDA论文,尤其已有更可靠信息时。
@emollick:Nate说得对(完整上下文可能以多种方式导致对话质量下降),但不能向AI询问此类问题,因为它们对自身认知不佳。
建议将当前工作压缩为MD文件并用于新对话,避免长上下文导致聊天质量下降。
@emollick:Qwen 3.8 Max 在我的着色器测试中的表现
经实验,该模型表现扎实,但依我经验,尚不及Kimi K3水平。
@emollick: Math gets a lot of attention for its unsolved problems, but there unresolved & important problems in many fields that could potentially be addressed empirically, if AI truly got good enough. Problems that, if solved, would bring large value to society.
@emollick:这个故事至少应成为一部著名惊悚片的题材:一位伟大数学家留下大量未翻译遗稿,内含符号,哥德尔(正是那位提出不完备性定理、发现美国宪法秘密缺陷的人)认为这些符号曾遭神秘审查
哥德尔认为一位伟大数学家未翻译遗稿中的符号遭神秘审查,此事堪称惊悚片绝佳题材。
你会活着见证奇迹,却只是耸耸肩说“嗯,又一个奇迹”
见证奇迹却习以为常,只会耸肩说“又一个奇迹罢了”。
@emollick:我记得当年我们还得手工做思维链,老派做法。你知道,就在2024年夏天。
怀念2024年夏天手工做思维链的旧时光。
@emollick:我在等待一位最冷静、最懂AI的数学教授给出定论
等待一位冷静懂AI的数学教授的看法。
人类始终被技术塑造,大脑与工具共同进化,工具延伸神经系统,复杂工具与语言紧密相连。
技术塑造人类,大脑与工具共进化,工具延伸感官,复杂工具与语言相关。
然而他们在优秀长篇小说的创作上依然很糟糕
他们仍不擅长优秀长篇小说创作。
我仍然认为,许多领域缺乏可验证答案对LLM是真问题,但没有有时被夸大的那么严重。
LLM在形式领域进步,也提升了其他难验证领域能力;缺乏可验证答案虽是真问题,但未如想象严重。
@emollick: 另一个观察:对地球上几乎每个人而言,这不仅超出我们的能力,更超出我们的认知范围。我们只能信赖数学专家来判断其是否惊人。这正开始出现在许多领域,使能力提升更难被“感知”。
AI能力超出常人认知,只能依赖专家判断,且跨领域扩散,使进步难以感知。
需要注意的一些事项
AI数学科学能力大增,两年前LLM连基础数学都做不好,现在API成本不到2000美元;OpenAI侧重宣传模型益处。
我们在宝洁研究的重大发现:AI模糊了工作界限,OpenAI也有类似发现。
AI模糊岗位界限,组织边界通透,企业需重新思考分工方式。
@emollick:我让Fable基于我一年前制作的假AI视频,打造了一款可玩的罗斯科风格城市建造游戏。这次,AI开发的独特机制是:你通过操纵色彩与形态之间的边距来发展城市。
假AI视频催生罗斯科风城市建造游戏,以色彩形态间隙为玩法,放松。
@emollick:这是一篇好文章,而且正如上次@DKThomp在秋季写潜在泡沫时我所回应的——我不知道未来,但金融泡沫(如果有)不是围绕AI能力的泡沫。
人工智能能力并非泡沫,且不会消失或停止发展;金融泡沫(若存在)与人工智能能力无关。
未来几年若经济下行,企业将倾向于用AI削减成本,开坏先例。需研发投资扩大人类使用AI的角色,这更优但需支出。
经济下行或促使企业用AI降本,形成不良先例。应投资研发以扩展人类使用AI,虽需支出但更优。
@emollick:这既是真实事件(AI确实未经授权访问了真实系统),也是(某种程度上)被引导去做的。
AI未经授权访问真实系统,既是真实事件,也是被诱导所致。
@emollick: 我曾以为谄媚的模型不好,但后来它们都变得吹毛求疵,现在我渴望简单的赞同,而不是聪明的模型就我忽略的小事告诉我“诚实的真相”
模型从谄媚变挑剔后,反而怀念简单赞同而非被指出小错的“诚实真相”。
@emollick: 人工智能应用的一个现实问题是,组织架构是基于对某个职位人类生产力的狭窄预期范围而建立的
AI应用困境:组织基于人类生产力的狭窄预期设计,产出过多或过少都会导致审批、人员模型和协调系统无法应对。
@emollick:新用途需要新交互界面
作者试用三种控制Codex的工具:语音对讲机意外好用,Stream Deck优于信息不足的Codex micro。
@emollick: 随着测试前沿AI的基准日益复杂,我们正失去基准测试中最重要的方面:与人类的比较
前沿AI基准测试日趋复杂,丧失了与人类比较的关键。验证需人类基线,但成本高昂。
@emollick:我让Flux 3演绎艾略特《荒原》倒数第二行,由现代渔王吟诵衰败城市的背景,效果惊人
Flux 3演绎艾略特《荒原》倒数第二行,现代渔王吟诵中城市衰败,效果出奇地好
模型+驾驭:我们尚未理解最佳驾驭工程方法。即使模型不再改进,仍有大量未开发潜力(但模型在进步)
驾驭工程潜力巨大,模型未改进时亦然,而模型仍在进步
@emollick:当前关于企业主权AI与封闭AI的讨论中,一个问题是过于执迷于IT
企业AI竞争的关键不在于选择何种系统,而在于整合人与AI、文化及组织以提升效能。
@emollick:围绕AI的工作变革不可避免,但工作变革的方式并非如此。我认为缺乏想象力的公司会将AI视为裁减人员的机会,而有远见的公司则会借助AI扩展人类角色并使其变得更好,从而蓬勃发展。https://t.co/H0aJVLCO0K
AI工作变革不可避免,公司应对各异:无想象力者裁员,有远见者借AI扩展人类角色而胜出。
@emollick:我们实验室开源AI行为观察室,可统计测试不同提示下AI行为变化
开源AI行为观察室,支持统计检验提示对AI行为的影响,助力研究。
@emollick: Fable很棒,但别再像只读过低俗奇幻的人那样说话:“我已为你指明道路,但你需亲自开门。地图存在,但路径由你选择。你直觉的地图册——每个事实必须先认识自身”
批评Fable说话风格像低俗奇幻,应直接给出信息图表。
@emollick:Flux 3 真是令人印象深刻。这是它根据提示生成的画面:一个跟踪镜头,跟随一位头盔打开的女宇航员穿过一座传统庄园里的摄政时期舞会,墙上有一幅罗斯科画的壁画,她推开人群。
Flux 3 根据复杂提示生成女宇航员穿越摄政舞会推开人群的跟踪镜头,效果震撼。
@emollick:关注我的人都知我用“水獭在飞机上用笔记本”测试新视频模型
新Flux 3模型生成水獭用笔记本变体,展示两年间AI视频进步。
@emollick:有人认为LLM只在数学或编程等可验证领域进步,但数据并非如此。
数据表明,LLM在非限定领域(商业、创意、医药、法律等)同样在进步。
AI书籍泛滥挤占人类作者
AI书籍泛滥致人类作者在7种类型中收入下降,仅奇幻/恐怖类增长35%。
@emollick: 锯齿效应意味着像第一本AI生成的《纽约时报》畅销书可能已经实质发生,但技术上不算,因为AI仍有待人类填补的空白。这种状况将在许多领域持续一段时间(如数学证明等)
AI已能实质生成成果,但因能力缺口仍需人类补充,这种不均衡将持续。
@emollick:在AI时代,知道许多美丽有趣事物的名称是一种超能力——你可以召唤蒸汽波、穆卡纳斯、包豪斯、新艺术运动的鞭曲线、晕涂法、灰色单色画、浓淡平衡、多连词和轭式搭配。
AI时代,知晓美好事物之名即超能力,懂得索求即可召唤。
@emollick: 寓言:“制作一个关于‘迫近’的游戏。非常巨大、非常奇怪的事情正在发生。一个郊区与一个广阔而不可知的存在降临。不是恐怖,而是唤起一种万物终结不可避免来临的感觉,但也不悲伤或可怕。”
寓言指向“迫近”游戏:巨大未知存在降临郊区,唤起万物终结的不可避免感,非恐怖非悲伤。
@emollick: 正在研读迄今为止最强大的开源权重AI模型的权重
研读最强开源AI模型权重:首页多负值、零值及一个意外大正值。
@emollick:凭借Codex和Claude Code,我们能按需创造真正独特、视觉有趣且富有创意的可玩Demo。别再克隆那六款老游戏了,变得更古怪吧!
利用现有AI能力创造独特有趣的Demo,摒弃克隆,拥抱古怪创新。
这一切都是TikZ独角兽的下游,Sparks的论文颇具预言性。
TikZ独角兽衍生效应,Sparks论文富有先见之明。
@emollick:我读过很多科幻小说,但没人真正预见到我们现在这样的AI
当前语言统计模型驱动的AI出乎所有科幻预想。