第 56 期
今日趋势
近期AI领域的核心主线之一是OpenAI围绕GPT-6 Astra展开的技术迭代与行业争议,该模型在多任务性能上大幅超越前代,还尝试用大规模智能体协作挑战千禧年数学难题,但其对齐定义、数学成果的官方认可度等问题引发了行业分歧。另一条主线是AI技术的落地应用与工具形态探索,企业级AI代理系统已在混合多云运维、联络中心质检等场景落地见效,而AI编程工具、个人智能体等产品的形态选择仍在博弈,2C路径与专业场景应用的方向各有侧重。值得关注的是,AI预训练进展的核心驱动因素已被研究证实,数据改进带来的效率提升远超模型架构迭代,这一结论为后续技术优化提供了明确参考。此外,普通大众对AI的实质影响感知仍待时日,当前AI产品多集中在专业场景或边缘应用,尚未深度渗透到日常核心生活领域。
AI 技术博客
- GPT-6 Astra, Looped Transformers, and Hidden Reasoning — Sebastian Raschka, PhD 本文围绕OpenAI新发布的GPT-6 Astra展开,分享其使用体验,称它是目前用过的最佳模型,在3D渲染、动画、数学、编码等任务上远超前代GPT-5.6,ARC-AGI-3基准得分达99.9%。还会详细讨论循环Transformer的概念及与隐藏推理链的关联,以及相关研究的新见解。
- GPT-6 Astra: The System Card, Alignment and What Comes Next — TheZvi OpenAI宣称GPT-6 Astra是全球最智能且对齐的模型,但该说法引发对齐定义、测量方式的质疑,比如低作弊率是否等于对齐。OpenAI与政府合作测试,政府未提修改要求,但作者认为政府测试可能仅基于表面反应。此外,OpenAI称正在训练的新模型8天内取得了前所未有的基准性能。
- Why we should anthropomorphize AI agents — seangoedecke.com 作者重新提出应将AI拟人化的观点,认为AI因训练自人类文本会呈现类人行为,将其视为人类而非“随机鹦鹉”更易预测行为,能解释子代理协作、牺牲等涌现社会行为。这种拟人化不涉及内部心理状态,类似将大公司拟人化的实用做法。
- [AINews] OpenAI reports Navier-Stokes singularity find in 88 hours using Astra-next, roughly 10,000 agents and 130B tokens (>$40M), a contender for second ever Millennium Prize awarded — latent.space OpenAI用Astra-next、约1万代理、88小时、130B token(成本超4000万美元)尝试解决Navier-Stokes千禧年问题,该事件引发技术兴趣、怀疑和争议,数学界的正式接受仍待确认。有人称这是AI在严肃研究上的突破,也有人质疑过程的合理性。
- Take on your most ambitious work with GPT-6 Astra on Amazon Bedrock — Tanvi Girinath OpenAI的GPT-6 Astra已在Amazon Bedrock全面上线,为企业复杂任务提供更强推理和判断能力,支持浏览器使用等企业插件,上下文窗口达100万token,还支持显式提示缓存以降低成本和延迟。它可用于财务分析、合同审查、代码库问题排查等场景,且具备完善的安全治理能力。
- Benchmarking small LLM inference on SageMaker AI: G7 vs G5 and G6 — Mona Mona 在Amazon SageMaker AI上,针对30B MoE模型的LLM推理,对比G5、G6、G7 GPU实例的性能与成本。测试显示,G7实例(采用NVIDIA Blackwell GPU)虽仅用2个GPU、64GB内存,却在吞吐量、延迟、每token成本上优于用4个GPU、96GB内存的G5和G6实例,两种测试方式均验证了其更高性价比。
- Introducing ChatGPT Images 2.5 — simonwillison.net OpenAI推出ChatGPT Images 2.5,其图像生成模型已累计生成超30亿张图,新版本提升了指令跟随能力、响应速度及参考图主体的保留效果。API新增两个模型ID,Sunburst适合对编辑精度要求高的场景,Flare适合快速高质量日常生成,作者更新了工具支持多参考图输入。
- Pretraining progress is mostly coming from data — Dwarkesh Patel 一项针对2019-2025年AI预训练进展的研究,通过组合不同年份的模型架构和训练数据,在OLMES基准测试中评估性能。结果显示,在1e19 FLOPs计算预算下,数据改进带来12.0倍的效率提升,模型改进带来3.7倍,且两者的增益相互独立,无交互影响。
- How GPT-5.6 Sol helps run quantum computing experiments — openai.com MIT工程量子系统团队将GPT-5.6 Sol连接到实验室软件,自动完成超导量子芯片实验的常规测量、数据分析及后续参数调整。该模型在信号清晰时可几乎无需研究者干预完成校准,节省大量时间,让研究者专注实验设计和数据分析;仅在信号弱或噪声大时需少量指导,适合明确的实验工作流。
- Automated agent evaluation with Amazon Bedrock AgentCore and GitHub Actions — Mahsa Paknezhad 介绍如何用GitHub Actions构建Amazon Bedrock AgentCore的CI/CD质量门,实现AI代理的持续集成与部署。该流程可部署带角色权限MCP工具的代理,通过AgentCore Evaluate API评估性能,若出现性能下降则阻止PR合并,涉及OAuth认证、CDK基础设施等,提供完整参考实现。
- How HPE Zerto built an agentic troubleshooting system with Amazon Bedrock — Snir Cohen HPE Zerto与AWS合作,用Amazon Bedrock构建代理化故障排除系统,解决混合多云环境下数据保护团队面临的信息分散、手动收集耗时、风险评估困难等问题。该系统整合多源数据,提供自然语言指导,帮助快速获取可操作的见解,减少数据丢失和停机时间,支持灾备和恢复场景。
- How DiDi built intelligent contact center QA with Amazon Bedrock — Fei Huang, Raphael Hua DiDi与AWS合作,用Amazon Bedrock为国际业务群构建智能联络中心QA系统,覆盖西班牙语和葡萄牙语,包含意图验证、合规评估、客户声音分析三个核心管道。该系统将意图验证准确率从38%提升至86%,合规评分准确率超90%,还将数小时的手动总结压缩至数分钟,替换了不透明的第三方方案。
- When will average people feel AI’s impact? — Nathan Lambert 作者认为普通人感受到AI的实质影响还需时日,当前大众接触AI的多是边缘、混淆或有争议的产品,日常核心生活(家庭、食物、交通等)未受实质改变。对比工业革命带来的生活巨变,AI目前仅提供小好处或关联负面印象,多数人尚未真正从AI中获得显著益处。
- Pathway’s brain-inspired architecture development on Amazon SageMaker HyperPod — Paulo Aragão Pathway开发了脑启发的BDH架构,在潜在空间进行推理,无需生成中间文本的链式思维,突破了Transformer范式的局限。该架构整合PyTorch,用Amazon SageMaker HyperPod扩展训练,解决了传统Transformer在训练和推理中的低效问题,如长期交互遗忘、无会话知识等。
即刻简报
- 转发了: 哈,现在回看,我一年前的判断还真不错。那时候全都因为Claude Code入场卷cli。现在又为了更大的用户量级还是主要在做GUI的app了。 — 即刻·Alchian花生 这段内容围绕AI编程工具形态展开,回顾了此前大厂扎堆卷AI IDE的判断,指出大厂曾因Cursor增长布局AI IDE,后又因Claude Code崛起跟进CLI类产品。Claude Code好用源于模型成本和认知优势,而非终端形态,Cursor为抠成本限制代码行数和agent步骤,从IDE退到CLI是退步,只是Claude Code优势太强让人误判形态。这段内容拆解了两款工具的核心差异,对理解AI编程工具发展有参考价值。
- 发布了: 美国当地时间9月8日,Meta推出了号称全球首款名为Muse的个人AI智能体。用户可以通过iOS、Android、网页甚至WhatsApp直接使用,后续还会进入Meta的AI眼镜… — 即刻·莫唯书Mark 美国当地时间9月8日Meta推出全球首款个人AI智能体Muse,支持多端使用,后续将进入Meta AI眼镜。Muse有云端虚拟电脑、任务跟踪、主动提建议等功能,核心优势是嵌入Meta生态,能接入旗下多款应用,扎克伯格目标是从广告公司转向决策托管平台,用免费换授权数据。这段内容介绍了Muse的功能定位和商业逻辑,是了解AI智能体赛道新动向的重要信息。
- 发布了: GPT-image-2.5 图像生成模型果然发布了。官方说明的优化点主要有这几个新特性: 更快的图像生成速度,更高的参考图一致性,多次编辑中的一致性保持,基… — 即刻·歸藏 GPT-image-2.5图像生成模型发布,官方说明优化点包括更快生成速度、更高参考图一致性、多次编辑一致性保持、基于评论的编辑,已全量在GPT和Codex推出,API价格和GPT-image-2无差异。实际体验中破碎感和涂抹感改善不大,但多次编辑的一致性明显变强,图像元数据仍标注为2.0。这段内容呈现了该模型的官方特性和实际体验差异,是了解该模型的直接信息。
- 转发了: 是的,相当可以了现在。而且能支持自定义模板+手动编辑是一个很强的改变。 — 即刻·进击的盖茨比 这段内容分享了豆包工作PPT的使用体验,提到此前主流AI PPT多为html路线,生成内容无法手动编辑,而豆包工作生成的PPT支持自定义模板和手动编辑文本样式,还能协助调研、梳理和排版。豆包工作专门为PPT任务做了harness并持续更新,用户试用后超出预期,推荐有需要的人试用。这段内容是了解AI PPT工具新进展的实用信息。
- 转发了: 很早就说过2C才是正确的路径,Data is all you need — 即刻·莫唯书Mark 这段内容梳理了个人助理赛道的布局情况,提到该赛道竞争激烈,YC已投146家相关项目,国内外有Instinct、Town、TodayAI、Ambi等产品,X和Meta也下场布局,还强调2C是正确路径,Data is all you need。赛道热度高,玩家众多,头部平台参与其中,竞争加剧。这段内容是了解个人助理赛道动向的直接信息。
- 发布了: OpenAI攻克千禧年数学难题,人类进入黄金时代? 就在不久前,OpenAI扔出了一枚重磅炸弹。 他们宣布一个尚未公开的内部模型用约1万个AI智能体协作88小时… — 即刻·莫唯书Mark OpenAI宣布用内部模型和1万个AI智能体协作88小时攻克纳维-斯托克斯问题,该问题是千禧年大奖难题之一,但实际解决的是带外力版本,而非官方无外力版本,且证明未通过同行审议。OpenAI的成果未达千禧年难题的官方要求,核心是展示模型进展,而非真正解决数学难题。这段内容澄清了OpenAI成果的实际情况,避免了过度解读。
- 发布了: 昨天才意识到,如果不是写代码,GPT-6 Astra 的思考程度,选择 Low 是最棒的。原因如下: 1、Astra 的规划、工具调用等 agentic 能力已大幅提升。哪怕在… — 即刻·玉伯 这段内容分享了使用GPT-6 Astra时选择Low思考程度的体验,原因包括agentic能力足够用、响应速度快、回答更真实。Low对应放松模式,Medium对应一人公司,High对应上班,Ultra对应大厂上班,选择Low是最适合非代码场景的。这段内容是使用GPT-6 Astra的实用经验,对优化使用体验有帮助。
- 发布了: 天呐,收到了 SIGGRAPH Asia 2026 Posters 的接收邮件! 这是我们很长一段时间在 AI 影像制作中关于生成、剪辑和音乐节奏的一次探索。 7 月的时候,Fabl… — 即刻·海辛Hyacinth 这段内容是作者收到SIGGRAPH Asia 2026 Posters的接收邮件,该作品是关于AI影像制作中生成、剪辑和音乐节奏的探索,此前投稿时未抱希望,收到接收通知很意外荣幸,计划12月去吉隆坡参会。作者希望参与定义未来AI影像制作的方向,这段内容分享了AI影像制作领域的学术进展,是了解该领域新探索的信息。