第 64 期
今日趋势
今天的简报围绕AI技术落地与安全伦理两大核心主线展开,前者聚焦性能突破、新范式探索及垂直场景应用,后者关乎行业对AI风险的认知升级与治理实践。技术维度,FlashAttention-4实现了大模型训练的显著性能提升,Jev新模型以极速响应、低开销为特点,同时AI在金融、工业安全等细分场景的落地推进,体现技术从通用向实用化渗透的趋势。安全伦理层面,AI生存风险议题受主流关注,Anthropic、OpenAI等企业推进安全合作与模型对齐报告框架,行业对AI风险的认知从分散转向共识性治理,同时也有关于AI伦理边界、责任认定的明确讨论。此外,行业层面呈现出AI核心价值从技术模型转向应用功能的标志性变化,B站民间测评、小米直播训练等动态也反映了行业对技术透明化、贴近用户需求的重视。
AI 技术博客
- Low Precision Flash Attention 4: End-to-End Block-Scaled Attention for Blackwell — Dev (Devashish) Shankar, Darren Liu, Chunzhi Yang, Jackie (Jiaqi) Xu,Markus Hoehnerbach, Jason Xie, Santosh Mohan, Han Xu, Rich Zhu, Josh Fromm, Hongtao Yu, Max Leung, and John Bocharov 本文介绍对FlashAttention-4进行扩展,加入MXFP8的前向与反向传播支持,在LLM形状下实现2.85 PF/s前向、2 PF/s反向的性能,内部形状下达2.54 PF/s前向、1.58 PF/s反向,相比BF16有最高1.6倍和1.52倍的提升。该实现将量化融合到周边操作,开发零聚合模块,已用于Meta的广告训练,代码已开源。这是首个用于生产训练工作负载的MXFP8 FA4实现之一,对大模型训练的性能优化有重要参考意义。
- Claude Cowork and chat are now one Claude — simonwillison.net Anthropic宣布将Claude Cowork与Claude Chat合并为单一的Claude服务,首先面向Pro和Max计划的用户,在网页、桌面及移动端逐步推出。此举旨在解决用户对不同Claude分支的混淆问题,让Claude成为通用智能体,类似OpenAI此前将Codex重命名为ChatGPT的调整。该变动简化了用户使用Claude的体验,减少了服务边界的认知成本。
- AI #186: The World Takes Notice — TheZvi Jacob Coxon辞职引发的连锁反应让AI安全议题受到主流媒体关注,Anthropic CEO提出需控制前沿AI,承诺嵌入调查,OpenAI跟进该举措,三家公司开始合作安全事务。公众对AI生存风险的平均估计从约15%升至30%,部分政客呼吁监管,特朗普将AI生存风险与数据中心对立,还有针对METR和有效利他主义的攻击,以及Anthropic关于Claude应对恶意使用的报告。该内容梳理了近期AI安全领域的关键动态,帮助了解行业反应。
- Optimizing agent system prompts with Amazon Bedrock AgentCore — Han Ding 本文介绍Amazon Bedrock AgentCore的系统提示优化功能,该功能可通过生产轨迹提出配置变更,经离线批量评估和在线A/B测试验证后推广。系统提示优化器使用AgentCore Observability的代理轨迹和奖励信号生成改进的系统提示,还会提供变更的解释。该内容深入分析了系统提示优化的推荐引擎工作原理及评估结果,对优化AI代理性能有实用价值。
- Quoting Mustafa Suleyman — simonwillison.net 本文引用Mustafa Suleyman的观点,认为不应将AI模型视为有情感、偏好、权利或福利诉求的实体,意识是伦理、法律和政治体系的基础,赋予AI这些权利会增加对齐和 containment的难度。该观点明确了AI伦理的核心边界,对理解AI与人类的关系有参考意义。
- [AINews] Reality Checks on AI News (Yegge shuts down Gas Town, Databricks’ +60% Astra cost) — latent.space 本周AI新闻提到Steve Yegge关闭Gas Town,称虽投入大量资金但仅用其构建了Gas Town;Databricks的Astra模型成本比Sol高60%;OpenAI发布模型 misalignment的跟踪框架及六起案例;还有小米MiMo-V2.6的RL训练等。AINews现在是Latent Space的一个板块,用户可选择是否接收邮件。该内容汇总了近期AI领域的多项动态,帮助了解行业最新进展。
- Underwriting Superintelligence: Backing Agents you can Sue — Rune Kvist, AIUC — latent.space 本文介绍AIUC获得4000万美元A轮融资,其AIUC-1标准用于AI代理的安全、可靠性和责任认定,解决AI代理故障后的责任问题。AIUC联合创始人Rune Kvist讨论AI采用的约束是信任而非能力,以及标准和保险的重要性。该内容探讨AI代理的责任与安全问题,对企业部署AI有参考价值。
- Our framework for reporting model misalignment — openai.com OpenAI推出模型 misalignment的报告框架,用于跟踪、调查和披露模型的异常行为,发布六起近期观察到的案例。该框架旨在加快misalignment报告的发布,即使未完全解释或缓解问题,还计划与政府合作建立报告机制。该内容介绍OpenAI的新框架,帮助了解AI安全报告的新方式。
- Improving HCLS AI reasoning with open-source agent skills — Michael Hsieh 本文分享38个开源的医疗健康与生命科学(HCLS)领域的AI代理技能,覆盖11个领域,用于解决AI代理错误应用决策框架的问题。这些技能以结构化文档形式存在,经评估可提升AI代理在药物发现、医疗操作等场景的表现。该内容提供实用的开源工具,帮助优化HCLS领域的AI推理。
- Helping older adults use AI in everyday life — openai.com OpenAI与OATS合作,为美国10个城市的1000名老年人举办免费的ChatGPT工作坊,帮助他们学习使用AI工具,包括规划行程、识别诈骗等。工作坊包含在线安全内容,教老年人识别诈骗信息,还会收集反馈优化未来资源。该内容介绍针对老年人的AI技能培训,体现AI的普惠性。
- Open Research, Tooling & Optimization at PyTorch Conference North America 2026 — PyTorch Foundation 2026年北美PyTorch大会将于10月20-21日在圣何塞举办,主题为开放研究、工具和性能优化,涵盖编译器架构、跨硬件内核等多个方向。大会将展示Torch.compile优化、多硬件内核DSL、低精度量化等内容,还有PyTorch维护者讨论AI代理对框架开发的影响。该内容介绍大会的核心主题和亮点,吸引相关从业者参与。
- Enhancing industrial safety AI with synthetic data on Amazon SageMaker AI — Dimitri Voytan 本文介绍用Amazon SageMaker AI的合成数据增强管道解决工业安全AI的训练数据稀缺问题,生成逼真的训练图像并自动标注。实验显示人物检测的mAP50提升达160%,无需手动标注或危险拍摄。该方法解决了工业安全AI的关键数据问题,对提升工业安全AI性能有重要帮助。
- Fault tolerant distributed training on Amazon EKS using NVRx — Aravind Neelakantan 本文介绍在Amazon EKS上使用NVRx实现容错分布式训练,解决大规模训练中的中断和检查点开销问题。该方案包含异步检查点、进程内重启等功能,在H100 GPU的2-8节点规模上有良好表现,代码可复现。该内容提供分布式训练的容错方案,对大规模AI训练有实用价值。
即刻简报
- 发布了: 研究了一下过去几年芯片和算力的供给情况。目前,市场上大约有 2000 万张 H100 等效卡的算力。按 Token 计算,年消耗量已经达到几十万亿亿 Token,相比… — 即刻·Barret李靖 这段内容梳理了近年AI芯片与算力供给情况,当前市场约有2000万张H100等效卡算力,年Token消耗量达几十万亿亿且年增近一个数量级。过去三年AI芯片算力供给年增约3倍,实际对外提供的Token算力年增或近10倍,不同AI产品形态升级会带动需求增长,未来Token需求或指数级上升,当前已长期紧平衡。它清晰拆解了Token供需的四个层面,能帮助理解AI算力的发展趋势与潜在缺口,值得关注。
- 发布了: 终于看到了大语言模型之后的一个新的模型范式 Jev 是系统1模型,极速响应,价格超低,但不经过语言系统,不能说话,完全客观,也不需要语言层面的对齐。… — 即刻·橘AI 这段介绍了一种大语言模型后的新模型范式Jev,它属于系统1模型,具备极速响应、价格超低的特点,无需经过语言系统,不能说话,完全客观且无需语言层面的对齐。该模型潜力较大,或成为通向AGI的另一条路径,相关信息为AI模型范式的探索提供了新方向,值得了解。
- 发布了: Kimi 敢于先做金融技术解决方案,真的很 respect ,高合规&低幻觉&长稳定的要求真不是一般模型敢挑战的。所以我很想知道在金融垂直场景下,哪家模型目前… — 即刻·进击的盖茨比 这段内容表达了对Kimi敢于推出金融技术解决方案的认可,认为其挑战了高合规、低幻觉、长稳定这类一般模型不敢应对的金融场景要求。作者好奇在金融垂直场景中,哪家模型当前市占率最高,以及该模型能解决的具体问题,相关内容反映了AI在金融领域落地的难点与关注方向,值得关注。
- 转发了: 是一个新的思路,对大众用户来说肯定是跟愿意做选择题而不是问答题的,但Jev目前主要面向的是开发者,还有待第三方评测,可以期待下后续的Use case — 即刻·莫唯书Mark 这段转发内容提及新模型Jev对大众用户而言更适合做选择题而非问答题,当前主要面向开发者,有待第三方评测,其在游戏、推荐系统、投资交易等领域有极大价值。同时指出国内对该模型的关注度和反响还不够,相关信息补充了Jev模型的应用场景与现状,值得了解。
- 转发了: 狗不嫌家贫,再贫也比当野狗条件好,越来越多的场景里,AI就是家,人就是🐶 — 即刻·iamsujie 这段内容以“狗不嫌家贫”的比喻,指出在personal AI浪潮中,没人在乎或讨论AI背后的具体模型,这是一个标志性事件,意味着AI的核心价值已从模型转向应用层面。现在人们更关注AI能实现的功能,而非其技术本身,相关观点反映了AI发展的阶段变化,值得思考。
- 发布了: 1 B 站上线了「AI 无限竞技场」,把站内 up 主对不同大模型的实测聚在一起做了个评测榜。现在专业 Benchmark 已经多到看不过来了,再搞一套民间测评是不… — 即刻·刘飞Lufy 这段内容讨论B站上线的「AI无限竞技场」,该平台聚合站内UP主对不同大模型的实测做评测榜,作者认为民间测评相比专业Benchmark有优势,专业考题易被模型过拟合,民间题不标准难针对性刷榜,更贴近真实用户需求。同时指出该测评有样本小等缺点但聚合有意义,相关内容为AI评测的多元形式提供了思考,值得关注。
- 发布了: 我操,太整活,太开放了! 小米 MiMo 团队居然在直播他们新模型 MiMo-V2.6 的RL 训练过程,看起来是一直在进行自动化的评估和测试。 然后一个特别的点是… — 即刻·歸藏 这段内容提到小米MiMo团队直播其新模型MiMo-V2.6的RL训练过程,训练中持续进行自动化评估和测试,且会实时显示训练成本。这种公开直播训练过程并展示成本的形式较为特别,能让外界直观了解模型训练的投入情况,相关信息为AI模型训练的透明化提供了新视角,值得关注。
- 转发了: 无人在乎,也不应该在乎,模型能力早已超出了人们99%的2C需求,如果不是100%的话。 — 即刻·橘AI 这段内容指出大模型的能力早已超出人们99%的2C需求,同时结合转发观点,提到在personal AI浪潮中,没人在乎或讨论AI背后的具体模型,这是AI发展的标志性事件,核心价值已从模型转向应用层面。现在人们更关注AI能实现的功能,而非其技术本身,相关观点反映了AI发展的阶段变化,值得思考。