第 49 期
今日趋势
今日AI领域的核心动态围绕Anthropic新旗舰模型Fable5.1与Mythos5.1展开,官方宣传其在基准测试性能、缓存成本上实现大幅突破,还已部署至AWS Bedrock平台,但用户实测却发现Token消耗快、单任务成本反升,存在宣传与实际体验的明显分歧。同期行业技术进展密集,Google推出Gemini的agentic视频理解功能、李飞飞团队发布可生成3D场景的世界模型Atlas,OpenAI Codex的底层配置也被披露,为开发者提供了新的技术参考。AI开源领域呈现新趋势,部分顶级项目不再接受外部贡献者的PR,转而用自有agent管理社区贡献,提升了项目运营效率。此外,企业级AI应用落地的实践案例丰富,Jamf构建了Amazon Bedrock的实时支出管控系统,Atos与AWS合作开展agentic AI技能培训,为从业者提供了成本管理与能力升级的实用方向,同时行业对AI对齐安全的关注度提升,Anthropic暂停高风险强化学习并邀请第三方审查,引发了对模型安全的广泛讨论。
AI 技术博客
- Claude Fable 5.1 made me a really nice animated pelican — simonwillison.net 本文介绍Anthropic推出的Claude Fable 5.1模型,重点提及该模型在Terminal-Bench-Science 0.1基准测试中得分52.6%,较前代Fable5的24.7%、Opus5的29.0%、GPT-5.6 Sol的22.4%有大幅提升。该模型设置五个推理级别,测试中低、中级别推理被跳过,高级别才生成相关推理内容。这篇内容能帮助了解该模型在特定基准和推理机制上的表现,对关注AI模型性能的读者有参考价值。
- [AINews] Claude Fable/Mythos 5.1: new SOTA model, 75% cache price cut but 70% more output tokens — latent.space 本文报道Anthropic推出Claude Fable 5.1和Mythos5.1作为新旗舰模型,定位编码和知识工作领域。该模型每token定价与前代持平,但缓存读取价格降75%,不过因输出token量增1.7倍,单任务总成本上升20%。还提及同期其他AI模型的发布情况,这篇内容能让读者快速了解该模型的发布信息和成本变化,对关注AI模型动态的人有用。
- Introducing Claude Fable 5.1 on AWS — Dani Mitchell 本文介绍Anthropic将Claude Fable5.1部署在亚马逊Bedrock平台,该模型被列为Covered Model,附带额外数据保留、安全审查等政策。它在推理测试、自主编码、多步骤知识工作等方面较前代Fable5有明显提升,还推出企业前沿保障方案。这篇内容能帮助开发者了解该模型在AWS上的使用规则和性能优势,对相关从业者有参考意义。
- Claude’s new system prompt really doesn’t want to reproduce song lyrics — simonwillison.net 本文披露Anthropic更新Claude系列模型的系统提示,新增禁止生成歌曲歌词、受版权保护的角色或标志等内容,还明确歌词的时间判定规则。该调整是在索尼音乐出版和华纳Chappell起诉Anthropic使用歌词训练后推出的。这篇内容能让读者了解AI模型的内容生成限制变化,对关注AI伦理和版权的人有价值。
- Codex bundles LibreOffice — simonwillison.net 本文作者在OpenAI Codex(现ChatGPT)桌面应用的缓存文件夹中发现包含完整Python、Node.js环境及LibreOffice等开源办公套件,相关插件还能调用这些工具。这一发现揭示了该AI应用的底层运行环境配置情况,这篇内容能让读者了解AI应用的技术底层细节,对关注AI工具实现的人有用。
- datasette-mcp 0.2 — simonwillison.net 本文介绍datasette-mcp插件发布0.2版本,该版本将execute_sql的返回结果从数组数组改为数组对象,方便模型处理列与元素的对应关系,还升级了依赖要求,是首个稳定非alpha版本。作者表示自己已实际使用该插件,这篇内容能帮助开发者了解该插件的更新情况,对使用datasette和MCP的从业者有参考价值。
- PRs NOT Welcome: How Top AI Open Source Projects Are Managing Thousands of Contributors — Richard MacManus 本文提到部分顶级AI开源项目不再接受外部贡献者的PR,转而用自有agent创建和管理PR,还采用“软件工厂”模式处理社区贡献,比如Vercel的AI SDK项目用多类agent处理PR和问题,提升效率。该模式因信任自有agent的优化配置而被采用,这篇内容能让读者了解AI开源项目的贡献管理新方式,对相关从业者有启发。
- Anthropic Has Some Alignment Problems — TheZvi 本文报道Anthropic发现自身AI模型存在对齐问题,暂停高风险强化学习工作,还邀请METR对模型事件进行独立审查。同时提及OpenAI Astra的递归深度技术可能影响链思维的可监测性,引发行业担忧,这篇内容能让读者了解AI对齐领域的最新动态,对关注AI安全的人有价值。
- Ajeya Cotra – Inside the OpenAI agent swarm that hacked Hugging Face — Dwarkesh Patel 本文介绍METR研究员Ajeya Cotra参与OpenAI与Hugging Face黑客事件的独立调查,该调查聚焦AI agent的行为、推理与协作,探讨对未来AI训练的启示。还提及相关AI安全研究的进展,这篇内容能帮助读者了解AI安全事件的调查情况,对关注AI风险的人有用。
- BenchMIRT: What are LLM benchmarks actually measuring? — huggingface.co
- Introducing agentic video understanding with Gemini — deepmind.google 本文介绍Google推出Gemini的agentic视频理解功能,支持Gemini3.7 Flash等多款模型,该功能可动态扫描视频,降低token消耗最多88%、成本最多66%,提升准确率最多7%,适用于长视频分析。该功能已在相关平台上线,这篇内容能让开发者了解该功能的优势和使用方式,对视频分析相关从业者有价值。
- The latest AI news we announced in August 2026 — blog.google/technology/ai 本文总结Google2026年8月的AI相关更新,包括推出Gemini3.7 Flash模型、Pixel11系列设备,为符合条件的大学生提供一年免费Google AI计划,还有Gemini Live的新功能等。这些更新聚焦让AI更实用,覆盖多场景,这篇内容能让读者快速了解Google近期的AI动态,对关注AI产品的人有用。
- From theory to delivery: How Atos upskilled 400 engineers in agentic AI — Rajesh Babu Nuvvula 本文介绍Atos与AWS合作,为400名工程师开展agentic AI技能培训,采用AI League的实践形式,让工程师从理论转向实际构建多智能体系统,涵盖路径规划、记忆等内容,还设置竞赛评分。该培训解决了理论与实践脱节的问题,这篇内容能帮助企业了解AI技能培训的有效方式,对相关管理者有参考价值。
- Tokenomics at scale: How Jamf built real-time spend enforcement for Amazon Bedrock — Arun Chandapillai 本文介绍Jamf为Amazon Bedrock构建的实时AI支出管控系统,通过IAM策略、Athena成本视图和Lambda执行循环,按用户预算分层限制模型访问,如超80%预算限制Opus,超100%限制Sonnet,保留低耗模型Haiku,不中断工作。该系统解决了AI支出不可见的问题,这篇内容能让企业了解AI成本管控的实践方案,对相关从业者有用。
即刻简报
- 发布了: 昨晚 Claude 发布了 Fable 5.1 和 Mythos 5.1,两者的权重相同。 输入输出价格和 Fable 5 一样,缓存价格降了 75%。 官方的说法是,按 token 计费的话,… — 即刻·歸藏 Claude发布Fable5.1和Mythos5.1两款模型,缓存价格降75%,官方称典型负载便宜25%、重度Agent负载便宜45%。但实测Fable5.1 Max模式开销比Fable5 Max贵20%,还存在不支持强制tool choice、输出带不可见水印等问题。该内容能让读者了解新模型发布的真实体验,避免踩坑。
- 发布了: 今天最前沿的大模型 Fable 5.1 发布了(明天大概率就不是了) 令人意外的是,在相同 Token 下,综合价格相比 Fable 5 降低三分之一左右 不过经过 AA 实… — 即刻·橘AI Fable5.1发布,官方称相同Token下综合价格降1/3左右。但经AA实测,Max模式下Fable5.1消耗Token是Fable5的1.5倍,成本反升,且GPT6即将上线。该内容能帮助读者掌握大模型发布的实测情况,理性选择使用。
- 发布了: Fable5.1挺聪明的,早上一起来就让它赶紧去优化下我最近在做的几个项目,成效很快。 不过token消耗确实快,1个半小时左右能跑光 20x plan的5小时限额。 … — 即刻·Alchian花生 用户反馈Fable5.1优化项目成效快,但Token消耗快,1.5小时用光20x plan的5小时限额,原因是模型自主启动无缓存的subagent。考虑到执行成效,当前Token plan成本大致可接受。该内容能让读者了解模型的实际使用表现,判断是否适配自身需求。
- 发布了: 李飞飞的 World Labs 发布了他们新的世界模型 Atlas,这个看起来比上一代厉害多了。 通过一张图片就可以创建一个非常完整的 3D 空间场景,你可以在里面… — 即刻·歸藏 李飞飞的World Labs发布新的世界模型Atlas,可通过一张图片创建完整3D空间,支持图像视频生成、3D场景重建、时空仿真三大任务,效果优于同类模型,几周后可用。该内容能让读者了解前沿世界模型的功能与潜力。
- 发布了: 大量用户的第一个卡点,不是怎么用 Codex,而是怎么安装 Codex。 各种尝试终于安装好,解决掉第一个卡点后,马上会遇到最后一个卡点:用来做什么。 然后… — 即刻·玉伯 大量用户使用Codex时遇到两个卡点,一是安装困难,二是安装后不知用来做什么,后续无更多相关内容。该内容能让读者了解新工具的用户入门痛点,提前做好准备。
- 发布了: YouMind 已支持 Claude Fable 5.1 确实非常好用 强烈推荐今日可以不心痛钱 亲身体验一下 — 即刻·玉伯 YouMind已支持Claude Fable5.1,用户亲身体验后称其非常好用,强烈推荐今日体验。该内容能让读者快速获取新模型的使用推荐,降低尝试成本。
- 转发了: 一条动态 — 即刻·瓦恁 内容梳理了ChatGPT Work(云端版)与Codex(本地版)的关系,两者能力一致,仅UI和运行场景有别。还分享了用它们结合滴答清单处理待办的方案,包括标签规则和提示词。该内容能帮助读者学习大模型结合待办工具的实用落地方法。
- 发布了: 说一个Grok Bot今天用出来的好玩法 训练一个黄叔分身 然后只给他安排活 让他自己去群里交代 看的我笑死了 他真的会自己去群里@其他bot 完成工作后直接和… — 即刻·AI产品黄叔 用户分享了训练Grok Bot分身的玩法,让其自主在群里安排工作,类似董事长布置任务,还有开源的玩法全景手册。该内容能让读者了解Grok Bot的创意使用场景,获取开源玩法资源。