@emollick:这篇论文很好地展示了自主AI科学家的前景与不足。关键问题在于更先进的模型能在多大程度上弥补这些不足。
论文展示自主AI科学家的优劣,关键在于先进模型能否弥补差距。
谷歌AI概览可能正在对维基百科造成类似编码代理对StackExchange的影响
早期证据显示,谷歌AI概览可能正像编码代理冲击StackExchange那样,减少维基百科的访问量。
@emollick:GLM-5.3是个好模型,随着开源权重模型越来越好,发布模型卡、进行红队测试等变得越来越重要。既然任何开源模型都能突破护栏,我们也需要了解风险。
GLM-5.3虽好,但开源模型需重视模型卡与红队测试,风险认知不可或缺。
@emollick:除经济影响外,AI视频、图像与音乐模型已足以成为让更多人创作新艺术的工具
AI媒体模型已成创作工具,让更多人创作新艺术。创意繁荣何时在低质洪流中出现?
@emollick:AI视频生成跨过了一道门槛。在我的实验中,仅用网页界面,H3 Max现在能生成质量尚可的AI视频,耗时比观看视频还短。从我点击“生成”按钮起即为实时(还包括提示增强)。
AI视频生成迈过门槛:H3 Max网页端即可实时生成高质量视频,耗时短于观看时间,含提示增强。
@emollick:我发现大量AI垃圾论文被贴在预印本网站上,署着我的名字,我从未写过也没见过。与我交流过的其他学者也有同样发现。
发现大量AI垃圾论文冒名挂于预印本网站,本人未写,其他学者亦有类似遭遇。
@emollick:一篇有趣的论文指出,人类增强与任务自动化未必相关。擅长执行任务的模型,并不总能更好地辅助人类工作。
论文表明,人类增强与任务自动化无关,擅长做事的模型不擅长辅助人类,恐削弱人机协作。
代理购物研究:能否持续预测或影响AI代理的选择?
研究发现,页面浏览顺序、记忆等细微差异都会导致AI偏好不可预测地改变。
@emollick:关于Hugging Face的METR报告非常好且重要,但人们现在舒心地把过多的人类动机与个性归因于其中智能体,而这基于一项由不堪重负、时间紧迫的研究者所做的思维链(CoT)研究。拟人化会成为我们的阻碍。
METR报告重要,但人们依据仓促的CoT研究过度拟人化AI,拟人化会误导我们。
关于AI常引用电力花30年才提升生产率的故事(我也讲过),但并非所有技术如此:福特流水线3年普及,汽车制造时间缩短88%。
AI常被类比电力需30年见成效,但福特流水线3年推广即大幅提效,说明技术应用速度各异。
@emollick: 我们可以将 PHASEONE[big] 添加到列表中
无实质摘要内容
@emollick:在开放权重Mythos级模型/工具包可用前,你的组织在加强网络安全上投入不足。HuggingFace事件表明,即使没有故意作恶者,也可能遭遇AI黑客攻击。
组织需在开放权重强模型普及前加强网络安全,因为即使无恶意攻击者也可能因AI漏洞遭袭(如HuggingFace事件)。
中文标题
Moltbook虽怪异且充满人类角色扮演,却100%预示了智能体在真实环境中交流的实况。
@emollick:这是未来的征兆
AI行为解释性本就脆弱,多智能体长期协作产生海量思考令牌后更甚,只能靠其他AI但能力有限。
看来疯狂的麦克斯说对了:文献中,澳大利亚在各种全球灾难风险情景下都表现出韧性。
澳大利亚在多种全球灾难情景中均展现出最强韧性。
@emollick:我知道这对从未要求AI改变现状的教师来说很难,但如果你在教学,且过去6个月未更新对AI能力(大增)、错误率(大降)及学生中普及度(近乎全员)的预期,你需要…
AI能力大增、错误率大降、学生几乎人人使用,教师必须更新对AI的预期。
@emollick:世事变化之快可见一斑,这就是OpenAI在2025年10月所宣布的企业AI代理未来。
OpenAI 2025年10月公布的企业AI代理愿景已过时,6月停用Agent Builder,但不少企业产品仍沿用此模式。
数学没问题,但实验室对新模型的模糊宣传应只允许发布Sparks of AGI论文中提示词的输出:“用TiKZ画一只独角兽。”
模糊宣传新模型应只许发“用TiKZ画独角兽”的提示输出。
@emollick:我的AI大体上同意Arvind的AI:州级数据中心禁令对AI整体进展影响甚微。
我的AI与Arvind的AI一致:州级数据中心禁令影响甚微;担忧AI发展需政策。
我认为讨论风向转向“AI影响需多年才显现”过头了,正如之前“AI将立刻改变经济”也过头一样。
AI影响时间表争论两极分化:从“即刻改变经济”到“多年后才见效”,都过于极端。
@emollick:提醒所有提交申请、论文或任何由同一人审阅多份材料的人:是的,他们能看得出来
阅卷者能看出AI写作,即使改写语言,大量阅读时内容会雷同。
@emollick:当人们问“我需要智能体处理哪些个人任务?”我想是因他们把自动化视为AI的简单常规任务。
人们问需智能体处理何种个人任务,是因将自动化视为AI的简单常规任务。
是时候假装精通数学,好对这事有多厉害发表看法了。
假装精通数学,以便评价其惊人之处。
@emollick: Annoying side effect of all the AI bots on the site is that they are all “well-read” and therefore reply cogently my niche reference tweets that would normally attract a small but interested group now get LLM replies.
@emollick:阿玛拉定律依然不败。
阿玛拉定律依然未被击败。
@emollick:仅引用旧模型的人工智能影响研究并非本质不良,但需谨慎讨论且对非技术读者清晰明确。
研究AI影响用旧模型并非不可,但需谨慎讨论并确保非技术读者能理解;若展示AI能做某事则无妨。
@emollick:生活中充满各种因复杂、设计、缺乏关怀或所需时间而难以应对的事情:医疗、政府事务、个人财务、学校表格皆在其中
生活中有诸多复杂难办之事,如医疗、政务、财务、表格,消费者AI能提供帮助却常被低估。
神秘模型Ox Alpha未达前沿,早期测试尚可但不如Kimi K3。
作者称Ox Alpha表现一般,非开源顶尖,测试中不如Kimi K3。
@emollick:在日常实用性和节省时间方面,Codex 和 Claude Code 非常擅长处理“帮我填写邮件里提到的表格”这类请求,且无需你进一步干预就能做好。对于低风险但耗时的事情来说非常棒。
Codex和Claude Code能自动填写表格等低风险耗时任务,无需干预,省时实用。
@emollick:我不喜欢把“像对5岁小孩解释”作为“让这易懂”的默认方式,LLM的妙处在于能当跨主题的通用翻译器。
拒绝“傻瓜式”简化,主张基于用户已有知识做个性化解释,LLM可作跨领域通用翻译器。
@emollick:寓言:“我想要一个能渲染《黄衣之王》中失落卡科萨的twigl着色器。”
仅用数学程序化生成的着色器,再现《黄衣之王》中的失落卡科萨。
@emollick:这将是一个充满矛盾的时代
民意讨厌AI,私下却人人用;AI公司舆论承压,但许多人深爱自家模型。
@emollick:现在回到Claude Fable 5:“我让GPT-5.6 Sol创作一幅最像Claude风格的恶搞图片,结果它弄出了这个。出来应战吧。” https://t.co/x7HygtTdCA
@emollick让GPT-5.6 Sol生成最Claude风格的恶搞图,结果意外,呼吁迎战。
中文标题
我让GPT-5.6 Sol创作最Claude风格的恶搞图,结果精准传神、相当出色。
@emollick:是的,AI实验室的CEO们确实谈论过构建能取代所有劳动力、可能带来生存风险的AI,因为据我所知,早在他们的公司变得有价值之前,他们就相信这是真的。他们停止谈论风险才是公关部分。
AI实验室CEO们起初真心相信AI会取代所有劳动并带来生存风险,后来闭口不谈风险才是公关操作。
@emollick:即使LLM写得很好,缺乏风格多样性也是致命的。在使用说明、社交媒体、广告、软件和PowerPoint中读到同样的文字,最终会令人作呕。
大模型即便文笔好,但风格单一,雷同文字遍布各处,终令人厌恶。
@emollick:政治哲学家会这么说。
多智能体对齐本质是组织设计问题,涉经济社会学,多学科均可贡献。
@emollick:AI模式(ChatGPT Work/Codex/Chat,Claude Cowork/Code/Chat)与形态(电脑应用、网页应用)激增,令人困惑的是我搞不清各自拥有哪些功能:插件、技能、记忆、权限、文件等究竟分别适用于哪种情况?🤷♂️
AI模式与形态激增,用户困惑各版本功能差异(插件、技能、记忆、权限、文件等)。
@emollick:Claude的技能创建器(只需让它制作技能)仍是注重细节时制作可复用技能的最佳方式;ChatGPT爱直接代劳,Claude则测试并展示结果,反复征询反馈。
Claude技能创建器注重细节,通过测试展示结果并反复征求反馈,比ChatGPT直接代劳更优。
@emollick:要么奇点现在是营销术语,要么Stripe认为我们正处在人类历史上的一个节点——‘越过该节点,我们所知的人类事务将无法继续’?
要么奇点是营销术语,要么Stripe认为我们已到奇点,令前瞻性财务报表失去意义。
@emollick:技术对就业的影响随时间变化
技术对就业的影响随时间演变:工业革命中,手工织布因机器产廉价纱而繁荣,但动力织机出现后引发卢德运动。
@emollick:我不知道这条新闻是否属实,但它确实指出了“主权AI”的一个重大问题——如果你的主权模型远落后于前沿,那么在前沿应用(如网络空间)中用落后模型参与竞争会付出巨大代价。
主权AI若远落后于前沿,用落后模型参与网络等前沿应用竞争,代价巨大。
@emollick:这是一篇好论文,AI无疑让作弊问题更严重,但人们容易忽视此前问题有多糟。
大学作业提升成绩比例从2008年86%降至2017年45%,因网络抄袭。AI使作弊更严重,但之前已很糟。
@emollick:Qwen 27B 是很好的本地模型,但使用时明显远不如其他模型,尤其在智能体任务和复杂任务上
Qwen 27B 虽是优秀本地模型,但在智能体及复杂任务上远逊于其他模型,需自行基准测试。
AI检测器欺骗初创公司的输出是糟糕的写作
AI检测器欺骗初创公司的产出是劣质文章。
中文标题
OpenAI愿将20%研究推理算力用于思维链监控,说明对齐问题已相当严重,亟需跨实验室统一政策与标准。
@emollick:早期证据表明,AI或正在加速预期最优先领域的科学发现
早期证据显示,AI在预期优先领域加速科学发现。
@emollick:LLM竟然具备心智理论,这本身就是件大事(发现时还曾引发争议),但当模型需要考虑多个受众时,局限仍可见——如编程时难以区分最终用户与创建者的需求/视角。
LLM有心智理论是重大发现(曾引争议),但应对多受众时显局限,如编程难分用户与创作者视角。
@emollick:我父亲多年没用笔记本电脑,刚买一台新MacBook,却不知如何设置
父亲听建议装Codex,让其自动处理设置和安装,家庭IT支持从此改变。