第 70 期
今日趋势
本周AI行业的核心动态围绕两大主线展开,一是头部大模型厂商Anthropic与OpenAI集中推出新模型并掀起价格竞争,Claude Opus5.5、GPT-6 Sol/Luna分别降价40%-50%,同时优化性能与沟通风格,推动行业向高性价比模型方向发展;二是AI工具与生态持续迭代,llm系列工具更新支持新模型,vLLM推出硬件无关模型,代理评估工具完善,还落地了东南亚AI技能培训项目,拓展AI应用场景。值得关注的共性是厂商均聚焦“成本-性能”的平衡,分歧则体现在用户反馈与策略差异上,有部分测试者认为前沿模型进入“大摆烂时代”,也有对GPT-6多档位设计的质疑,不同平台的风控策略差异也引发讨论,整体呈现出技术迭代与市场竞争交织的行业态势。
AI 技术博客
- Claude Opus 5.5, GPT-6 Sol, GPT-6 Luna, and a new price war — simonwillison.net 近日Anthropic推出Claude Opus5.5,OpenAI同步发布GPT-6 Sol与Luna,引发AI模型价格竞争。GPT-6 Sol和Luna的API价格较前代GTP-5.6降低50%,其中GPT-6 Luna输入、输出价格大幅下调,成为高性价比模型。Claude Opus5.5优化了沟通风格,价格比前代Opus5低40%,还提升了token效率,值得关注AI模型的成本与性能平衡趋势。
- [AINews] Claude Opus 5.5, the new default model for AINews — and everybody cuts prices 40-50% — latent.space Anthropic推出的Claude Opus5.5成为AINews的默认模型,其性能接近Claude Fable5.1,运行成本比前代Opus5降低40%,速度提升约30%。该模型优化了沟通方式,能将关键信息前置,解决了前代Opus的沟通问题,同时订阅时长限制提升20%,成本效率更高,适合AI新闻等专业场景使用。
- SF October 14th: A Birds of a Feather Session on Agentic Engineering — simonwillison.net 10月14日,旧金山将举办由Jesse Vincent主持的Agentic Engineering主题Birds of a Feather活动,面向开发编码代理的从业者。活动以非正式展示交流为主,鼓励分享未公开的实验、未完成项目等,聚焦探索性内容而非产品推销,适合对Agentic AI感兴趣的开发者参与交流。
- llm 0.36 — simonwillison.net llm工具发布0.36版本,新增支持OpenAI GPT-6 Sol、Luna模型,同时允许模型插件声明不支持多轮对话,此时工具会抛出对应异常。该版本还优化了llm日志的推理追踪展示方式,新增details标签包裹内容,同时修复了多项bug,提升工具的兼容性与使用体验。
- llm-anthropic 0.29 — simonwillison.net Simon Willison在2026年9月22日发布llm-anthropic工具的0.29版本,该版本新增对Anthropic Claude Opus5.5模型的支持,用户可通过该工具调用Claude Opus5.5进行AI交互。此次更新是llm工具系列的一部分,同期还更新了其他相关AI模型支持内容,为开发者提供更多模型选择。
- Better prompt caching for GPT-6 — openai.com OpenAI为GPT-6系列推出优化的提示缓存功能,提升默认缓存命中率,新增工具帮助开发者监控缓存性能、诊断未命中原因,还支持显式缓存断点、调整推理效率不中断缓存等功能。该功能可降低API调用成本,提升响应速度,已有开发者通过优化缓存命中率实现成本降低20%-36%的效果,适合长期运行的AI代理场景。
- Introducing GPT-6 Sol and Luna — openai.com OpenAI推出GPT-6系列的Sol和Luna模型,这两款模型基于GPT-6 Astra的技术,API价格较前代GTP-5.6降低50%,分别针对复杂日常任务和高吞吐量重复任务优化。它们在专业工作、事实性、编码等方面性能提升,成本效率更高,能让更多日常AI应用和规模化项目落地,适合不同规模的开发者使用。
- Bring more intelligence to everyday work with GPT-6 Sol and GPT-6 Luna on Amazon Bedrock — Tanvi Girinath OpenAI的GPT-6 Sol和Luna模型已在亚马逊Bedrock平台正式上线,这两款模型兼具智能性与效率,分别适配复杂日常任务和高吞吐量重复任务。它们的API价格较前代大幅降低,能帮助开发者将GPT-6的能力应用到生产场景,提升工作效率,适合各类企业和开发者的AI项目部署。
- Claude Opus 5.5 is now available on AWS — Aamna Najmi Anthropic的Claude Opus5.5已在AWS的Amazon Bedrock和Claude Platform上线,它是Claude5.5系列的首款模型,适合代理编码、知识工作和长期任务。该模型优化了沟通清晰度,价格比前代更低,还新增安全分类器,能更频繁拒绝不符合要求的请求,适合需要一致性和深度的行业场景。
- llm-typesafe 0.1a0 — simonwillison.net llm工具发布llm-typesafe 0.1a0版本,新增支持TypeSafe的Jev模型,用户可通过该工具调用Jev模型处理不同类型的查询,包括yes/no判断、选择分类、评分等。该插件提供了详细的安装和使用说明,帮助开发者快速集成Jev模型到llm工具中,拓展AI交互的能力。
- Know Who Spoke When: Build Real-Time, Multi-Speaker AI with NVIDIA Nemotron 3 Diarization — huggingface.co NVIDIA推出Nemotron 3的说话人 diarization功能,支持构建实时多说话人AI,该内容更新于2026年9月23日,相关内容获得一定互动量,为多说话人语音交互场景提供技术支持,适合需要区分不同说话人的AI应用。
- Grab and OpenAI bring practical AI skills to Southeast Asia — openai.com Grab与OpenAI在东南亚推出“GO Forward with AI”项目,计划在两年内帮助3万名Grab的司机、配送员和商户学习实用AI技能,提升工作效率和业务能力。项目先在新加坡启动,后续扩展到泰国、印尼等国家,基于OpenAI Academy课程设计,通过线下工作坊等方式培训,助力东南亚平台从业者利用AI提升发展机会。
- Hardware-Agnostic Models in vLLM — Thomas Parnell (IBM), Thomas Ortner (IBM), Richard Zou (Meta), Harry Mellor (Hugging Face) vLLM推出硬件无关模型,解决前沿开源模型与torch.compile不兼容的问题,确保在不同硬件(如NVIDIA、AMD、Intel等)上保持高性能。该模型在NVIDIA H100上的token吞吐量接近原生实现,适配快速发展的前沿模型架构,为开发者提供更广泛的硬件兼容性,支持更多模型部署场景。
- Evaluate skill-equipped agents with Strands Evals and Amazon Bedrock AgentCore — Sangmin Woo Strands Evals SDK与Amazon Bedrock AgentCore推出针对技能化代理的评估能力,技能是模块化的任务单元,可跨代理复用。该评估工具新增技能选择准确性、技能指令遵循度两个维度,解决通用输出质量指标无法检测的代理失败问题,帮助开发者更准确评估技能化代理的性能,提升代理可靠性。
即刻简报
- 发布了: Opus 5.5 和 GPT-6 Sol 同日发布。 分别测完之后,我只能说前沿模型进入大摆烂时代。 — 即刻·评论尸 本次内容提及Opus 5.5与GPT-6 Sol在同一天发布,发布者对两款新模型分别进行了测试。测试后发布者认为,当前前沿模型已进入“大摆烂时代”。该内容是发布者对两款新发布模型的直接测试反馈,能快速了解其对前沿模型发展阶段的看法,值得一读。
- 发布了: 今天手动充值后,又蹬了接近50%的20x周额度。 整体来说呢,Opus5.5在速度,成本上都明显比Opus5好了不少。性能来说的话,写作能力的可控性强了不少,以… — 即刻·Alchian花生 本次内容围绕Opus 5.5的使用体验展开,发布者手动充值后完成了相关额度操作。发布者表示Opus 5.5在速度、成本上优于Opus 5,写作能力的可控性更强,还能较好处理3D及动态动画内容。该内容是发布者对Opus 5.5的实际使用反馈,可帮助了解其性能提升点,值得一读。
- 发布了: 其实Personal Agent这波是真风口还是伪风口并不重要,重要的是借这个机会好好探索和挖掘下Solid的C端场景和Agent的Proactive能力 — 即刻·莫唯书Mark 本次内容讨论了Personal Agent相关的发展方向,发布者认为其是否为真风口并不关键。核心重点是应借此机会,深入探索Solid的C端场景以及Agent的Proactive能力。该内容明确了Personal Agent相关的探索重点,能为相关方向的从业者提供思路参考,值得一读。
- 发布了: GPT-6 模型系列现在有 Luna、Sol、Astra 三个尺寸。 每个尺寸有 No Thingking、Low、Medium、High、xHigh、Max 六个思考等级。 也就是说,累计有 18 档… — 即刻·评论尸 本次内容介绍了GPT-6模型系列的构成,包含Luna、Sol、Astra三个尺寸,每个尺寸有6个思考等级,累计18档智能水平。发布者对这18档智能水平提出质疑,认为其并非线性升高,也没人能正确选择所需档位,Auto也无法解决该问题。该内容是发布者对GPT-6档位设计的直接看法,能了解其对模型档位设置的态度,值得一读。
- 发布了: 终于用上最近很火的 Muse 了! Anthropic 的风控在 Meta 面前就是弟弟。 小扎的产品说不让你用,你根本用不上,连账号都注册不了。根本不给你被封号的机… — 即刻·歸藏 本次内容分享了使用Muse的体验,发布者称终于用上了近期热门的Muse。发布者对比了Anthropic与Meta的风控,认为Anthropic的风控不如Meta,Meta的产品若不让使用,连账号都注册不了,不会给被封号的机会。该内容是发布者对两款产品风控的对比体验,能了解其对不同平台风控的看法,值得一读。
- 发布了: 没想到 Opus 5.5 先来了,他们说这次 Opus 5.5 的大部分能力达到了 Fable 5.1 的水平。 这次居然降价了,比原来的 Opus 5.0 降了一点点,平均任务消耗的… — 即刻·歸藏 本次内容介绍了新发布的Opus 5.5,其大部分能力达到Fable 5.1的水平。Opus 5.5有多项优化,包括降价、平均任务消耗金额降40%、增加5小时使用额度并重置,还优化了写作和回复问题,发布者期待其能“说人话”。该内容是Opus 5.5的核心更新信息,可帮助了解其升级点,值得一读。
- 发布了: 阿里的 Qoder ,从官网,到 Desktop App。 设计和审美都已经来到国内 Top 1 级别。 官网是 Cursor 风味 混合 抹茶田园质感。 Desktop 启动时的 Auto Onb… — 即刻·赵纯想 本次内容评价了阿里的Qoder产品,称其官网和桌面App的设计审美达到国内Top1级别。官网是Cursor风味混合抹茶田园质感,桌面启动的Auto Onboarding复刻了Dia浏览器的效果,团队中有话语权大的高审美人员。该内容是对阿里Qoder设计的高度评价,能了解其产品设计亮点,值得一读。
- 发布了: 大降价时代来临,GPT 6 Sol 和 Luna 降价 50%,Opus 5.5 降价 40% 今天,GPT 6 全系列更新,Sol 和 Luna 价格下降 50%,并且学会了说人话,而 Terra 消… — 即刻·橘AI 本次内容围绕大模型降价展开,提及GPT-6全系列更新,Sol和Luna降价50%、学会说人话,A社Opus 5.5也有降价及缓存调整,同时A社还禁止中文客户使用、API成本高并强制收集数据。发布者认为当前迎来大模型大降价时代,感谢相关竞争推动。该内容汇总了多款大模型的更新及降价信息,能快速了解行业动态,值得一读。