@svpino:我曾从事机器人和无人机的计算机视觉模型工作,没有什么比为测试代码而运行机器人更慢的了。
数字孪生模拟物理世界,免去真机测试之慢。
@svpino:我已经好几个月没有读过一行AI生成的代码了。
数月未读AI代码,人工读码已低效。代码带宽低,量多噪声大,转而侧重其他信息源。
@svpino:AI工程远不止学习如何提示模型
AI工程远不止学习提示模型,涵盖更广泛技能与知识。
一些公司仍只用老式问题招聘(不涉及AI)
部分公司仍以传统问题招聘,不涉及AI;多数公司已允许候选人在面试中使用AI,或专门考察AI辅助开发能力。
一位因公司禁止而无法使用AI的开发者
开发者因公司禁用AI而落后,恐成最后一份编程工作,面临裁员风险,我劝他换工作。
@svpino:Cline是朋友公司中第二受欢迎的编程代理(仅次于Claude Code)
因与五角大楼签约,朋友公司弃用Claude Code并迁移至Codex,同时统一迁移Cline用户。
@svpino:盲测中,用户认为Visko Orbis 1.0生成的视频最佳。
盲测中该模型生成的视频获选最佳,其人物、物体及场景一致性强,此仍是当前视频生成难题。
@svpino: Many such cases. I know one who did this as well: get on with AI or get out.
@svpino: 5 design patterns for long-running agents:
@svpino: Many people have no idea what's happening.
@svpino:我希望所有开放模型提供商都能向这些家伙学习,开始公开训练代码、评估、日志和权重。
希望开放模型提供商公开训练代码、评估和日志;开放权重虽好,开源更佳。
@svpino:🐐 https://t.co/jb1xkPOUOf
推文仅为山羊表情与链接,无实际文字内容。
@svpino:这是一个很酷的基准测试,通过视频游戏测试智能体。
用速通游戏评估智能体的规划、行动、学习和长序列决策优化能力。
GPT-6 Astra 以99.9%得分饱和ARC-AGI-3,并以100%得分饱和ExploitBench。
GPT-6 Astra 在 ARC-AGI-3 得99.9%,在 ExploitBench 得100%,连 Fable 也未达到。
@svpino:不存在普遍最优模型
不存在普遍最优模型,最佳应用常组合多模型互补,按任务、响应质量、成本、可靠性比较并看组合效果。
我不喜欢智能体旁听会议(因为不会读它们的笔记),但确实想要它们帮我处理邮件和日程。
愿用AI处理邮件日程,不愿其旁听会议记笔记。
@svpino: This is how I'd like the Chrome Inspector to work in 2026:
你知道我们为那些公司“构建上下文”花了多少钱吗?
AI时代,上下文质量是企业最重要的竞争优势;模型相同时,上下文质量决定成败。
@svpino: Two ways to stay up to date on what's happening with AI and agents:
@svpino:我和孩子正为此纠结
纠结孩子用AI:既怕他逃避思考,又想让他了解潜能。目标:教他建立模型,判断何时用AI、何时独立思考。
@svpino:对任何希望看到开放模型成功的人来说,这都意义非凡!
首次见到开放模型发布检查点级日志,每个模型的训练代码、数据预处理、评估和日志均已公开,意义重大。
@svpino:大量开发者此刻正经历艰难时期。
开发者身份曾系于编码,如今人人能写代码,他们不写代码又是谁?作者持务实态度。
@svpino: 如果你的智能体执行代码,则应将其置于隔离环境中运行
智能体执行代码必须隔离运行,否则可能毁掉系统;这是务必遵守的铁律。
@svpino:约100毫秒延迟对文本转语音模型而言确实很快
约100毫秒延迟对TTS模型很快;参考:朋友公司生产用语音模型平均延迟超300毫秒,日处理约7500条消息。
本地模型不可避免
本地模型将解决90%的问题,只有最复杂问题才需外部硬件。
@svpino:许多想学计算机视觉的人不知道从构建什么开始学习。
亚马逊开发者举办虚拟黑客马拉松,提供19万美元奖金,是学习计算机视觉的绝佳实践机会。
@svpino:这对管理邮件、日程和旅行非常有用
该工具擅长管理邮件、日程与旅行,旅行中可找更优价格、提前预订并自动重新预订降价,省时省力。
@svpino: There’s an explosion of companies looking for help with AI.
@svpino:两年前,你若说编写代码已过时,人们会冲你大喊大叫。
两年前“写代码过时”遭斥,今成共识;如今“阅读代码过时”正在重演,一两年后无需再手动阅读AI生成代码。
@svpino:我不再看代码了,所以评估输出是我现在的主要工作
不再阅读代码,工作重心转向评估输出。
@svpino:开发应用时的三个陷阱
构建应用时,始终用最佳模型太贵,最便宜模型太蠢,中间模型平庸,应按需选择。
试试这个,如果你想享受生成视频的乐趣
实时引导视频生成,中途可改提示词,与常规“提示词→视频”体验不同,边生成边调整。
@svpino:我们的Token成本几周内增至三倍
Token成本几周内增至3倍,无故障且仅少量智能体运行。追踪发现:智能体读取更多文件、加载更多上下文并创建更多内容。
@svpino:许多长期坚持的原则和实践适用于智能体编码时代,但也有很多并不适用。
长期原则与实践部分适用于智能体编码时代,部分失效,众人皆在摸索前行。
@svpino:这个想法很棒:智能体学习平台。
让智能体基于真实生产经验自我学习,从行为后果中提取教训以改进。
@svpino:如果你给我发AI生成的消息,我会把你的邮件(或信息)直接丢进垃圾邮件。
AI生成的消息我会直接拉黑。你不花时间跟我说话,我凭什么理你?
@svpino:这本书包含了你使用Codex成为顶尖1%所需的一切。
这本书让自认高级用户的作者几天内学到比过去两个月更多的技巧,尚未读完已收获颇丰。
@svpino:GLM-5.3 现已开放权重!
GLM-5.3 开放权重,可下载或通过 Atomic Agent 运行。无论大厂怎么说,未来属于开放权重。
@svpino:这不仅仅是又一个编程代理
与Claude Code+Opus 4.8相比,PRAXIST在75项任务中获49金(对手35金),成本约3千美元(对手约3.8万),性能更优且成本仅为约十二分之一。
AI虽好但耗水惊人
AI虽好但耗水惊人。你出价的75%将用于让更多人获得安全水源。
计算机使用模型低效点击问题
n2模型以27B参数改变计算机操作方式,避免冗长点击,高效完成任务。
@svpino: how did a linux distro become political?
@svpino:ChatGPT现在开始展示广告,我敢打赌这会成为企业最赚钱的渠道之一。
ChatGPT开始展示广告,将成为企业最赚钱的渠道之一;Runable可代管广告投放。
向量索引不够,企业需要全面的上下文层
向量索引不足,企业需上下文层:统一权限数据、按类型检索、模型前排序过滤、图谱记忆保留关系与学习。