第 69 期
今日趋势
今天的AI动态主要围绕两大核心方向展开,一是模型形态与性价比的创新竞争,TypeSafe推出的决策模型Jev、小米开源全模态模型MiMo等新形态模型不断落地,且呈现“要么极致性价比要么前沿能力”的发布逻辑,Jev仅收输入token费、MiMo训练成本可控,凸显开发者对低成本AI方案的迫切需求;二是AI落地的实践与分歧,既有Shopify优化模型生产效率、Benchling筑牢多租户AI代理安全的成熟案例,也有国内大厂布局个人Agent时面临的生态、战略拧巴,以及AI生成内容存在隐形错误、AI安全议题出现政治态度分化等现实问题。
AI 技术博客
- Jev introduces a new shape of LLM - System One, aka Decision Models — simonwillison.net 这段介绍TypeSafe AI推出的Jev是System One类的决策模型,区别于普通LLM,它输出对应类别的浮点数与置信分,仅收取输入token费用(0.042美元/百万,比OpenAI GPT-5 Nano更便宜),支持Yes/No、选择、评分三类问题,适合分类类任务。它的技术特点和成本优势对想优化AI应用成本的开发者有参考价值。
- [AINews] Xiaomi MiMo-V2.6-Pro 1T-A42B: the new top Open Weights model, trained for $3M — latent.space 小米推出MiMo-V2.6-Pro等开源全模态模型,其中MiMo-V2.6-Pro是当前能力最强的版本,MiMo-V2.6-Flash兼顾智能、效率与成本,还有超高速版本。该模型训练成本约300万美元,部分训练工具和环境代码已开源。它作为手机厂商推出的前沿AI模型,打破了外界对小米的固有认知,相关技术细节有参考意义。
- Jev: System One models for Prod, not God — with Diogo Almeida, CEO, TypeSafe AI — latent.space 这段围绕TypeSafe AI推出的Jev展开,提及Jev的多种应用场景,包括游戏、编码、用户旅程分析等,还涉及对KV缓存的相关观点。相关播客内容分享了Jev的设计理念和应用方向,对想了解决策模型落地的人有帮助。
- How Shopify built a continual learning loop with PyTorch and vLLM — Cody Mazza-Anthony, Sr. Staff Machine Learning Engineer, @cmazzaanthony & Andrew McNamara, VP Machine Learning, @drewch 这段介绍Shopify通过PyTorch和vLLM构建持续学习循环,将生产中的失败经验压缩到模型权重,其效果优于前沿模型,成本降低96%。该案例展示了企业如何优化AI模型的生产应用,对有类似需求的企业有参考价值。
- Debating RSI, the US-China Gap, and Jaggedness with JS Denain of Epoch AI — Nathan Lambert 这段是与Epoch AI的JS Denain的对谈,讨论了RSI、中美AI模型差距、蒸馏是否解释差距等多个AI相关话题。对话内容涵盖AI发展的多个关键议题,对想了解AI行业动态的人有参考意义。
- Transformers now runs llama.cpp quants — huggingface.co 这段提到Transformers现在支持llama.cpp的量化模型,该模型参数为4B,更新于3月2日,有908k下载量等数据。相关信息展示了模型工具的更新情况,对使用相关工具的开发者有参考价值。
- Writing Rust code that’s faster than state-of-the-art libraries by asking agents to make the code faster — minimaxir.com 这段介绍通过agentic LLMs可以写出比现有库更快的Rust代码,加速范围在2到20倍,还包含测试和基准结果。相关内容展示了LLMs在代码优化上的能力,对开发者优化代码有帮助。
- xAI’s Grok 4.6 is now available in Amazon Bedrock — Suheel Farooq 这段提到xAI的Grok 4.6已在Amazon Bedrock上线,该模型有500k token上下文窗口,支持四级推理,适合长代理、编码等任务。它是xAI第二款加入Amazon Bedrock的模型,相关信息对使用Bedrock的开发者有参考价值。
- Cheaper LLM labelling — a@xkqr.org (kqr) 这段介绍用便宜的LLM(如GPT5.6 Luna)对commit进行分类,测试显示准确率符合需求,还提供了简单的脚本示例。相关内容展示了低成本LLM在数据标注中的应用,对有类似需求的开发者有帮助。
- Politics Gets Interested In Those Trying Not To Die — TheZvi 这段提到AI的生存风险引发全球关注,多位科技界人士呼吁安全措施,但特朗普将其称为骗局,政客态度分化。内容展示了AI发展背后的政治博弈,对想了解AI政策的人有参考意义。
- Jun Kim, oMLX creator and maintainer, joins Hugging Face to support the MLX community — huggingface.co 这段提到oMLX的创建者Jun Kim加入Hugging Face,以支持MLX社区,oMLX将保持Apache 2.0协议,发展更稳定。相关信息展示了MLX社区的动态,对使用MLX的开发者有参考价值。
- TinyTorch: Don’t Just Import PyTorch. Build It. — Vijay Janapa Reddi, Harvard University and ETH Zurich · Andrea Mattia Garavagno, ETH Zurich 这段介绍TinyTorch是免费开源课程,可在纯Python中从张量到transformers构建ML框架,4GB内存的笔记本即可运行。它类似MINIX、Tiger编译器等教学框架,对想学习ML框架内部的人有帮助。
- How Benchling secured multi-tenant AI agents with Amazon Bedrock AgentCore — Jeremy Stashewsky 这段介绍Benchling用Amazon Bedrock AgentCore构建防御纵深架构,保护多租户AI代理的科学代码执行,处理超600次会话,零安全事件。该案例展示了多租户AI代理的安全方案,对有类似需求的企业有参考价值。
- It’s Not Just True, It’s False — rss@idiallo.com 这段提到用LLM生成工作内容存在隐形错误,比如某电信公司的AI总结把“embroidery”列为行动项,需仔细校对。内容提醒人们使用AI生成内容时要注意错误,对日常使用AI的人有帮助。
即刻简报
- 发布了: Jev 背后的野心,是完全的自动化 9 月 15 日,一家叫 TypeSafe 的公司发布了自己的第一个模型 Jev:它不生成文本,只输出判断,给一个问题,返回一个带… — 即刻·橘AI 本文介绍TypeSafe公司9月15日发布的首个模型Jev,它不生成文本仅输出带置信度的判断,速度比前沿大模型快200倍、价格便宜400倍,核心目标是改变模型训练范式。文中还分析了AI当前能力强但信任低、RLHF带来谄媚与幻觉等问题,提出Jev的校准决策是新路径,对理解AI模型新方向有参考价值。
- 转发了: mark — 即刻·进击的盖茨比 本条是对TypeSafe公司发布Jev模型相关内容的转发,该模型不生成文本仅输出带置信度的判断,速度比前沿大模型快200倍、价格便宜400倍,核心是改变模型训练范式,还涉及AI现状、RLHF问题等分析,传递了Jev的核心信息及背后的AI训练思考,适合关注AI新动态的读者了解进展。
- 发布了: 国内大厂做个人Agent各有各的拧巴 海外那波个人Agent的热闹聊完之后,回头看国内会发现一个很有意思的现象。站在大厂自身利益的角度每一家都觉得自己应… — 即刻·莫唯书Mark 本文分析国内大厂布局个人Agent的现状,指出微信小微定位克制,先做生态内通用Agent;字节豆包因战略重心转B端,需打通数据墙;阿里千问打通生态但定位模糊,或与淘天利益冲突;小红书点点整合内容与交易,还提到国内个人Agent的核心门槛是生态、组织与战略,对了解国内AI Agent发展有参考意义。
- 发布了: 感觉现在发模型只能走两个极端: 要么在最便宜的模型里做到最厉害,要么就直接做最前沿的模型,否则就完全没有讨论度和使用度。 昨晚的两个发布:Grok 4… — 即刻·歸藏 本文指出当前发布模型需走“最便宜里最厉害”或“最前沿”的极端路线,昨晚Grok4.7与Mimo V2.6发布,二者能力相近但价格差异大,Mimo V2.6输入输出价格远低于Grok4.7,Mimo还推出桌面端及图像生成功能,两家赶在OpenAI可能发新模型前推出,对比了近期模型的价格与策略,对关注AI性价比的读者有参考价值。
- 转发了: 有一点忘了说就是用Muse或Grok Bot可以白嫖一个US IP的云电脑,具体可以用来干嘛就不用我多说了 — 即刻·莫唯书Mark 本条是转发内容,提到Muse或Grok Bot可白嫖US IP的云电脑,还转发了关于Personal Agent的播客,称其信息量高,传递了实用工具信息及优质播客推荐,适合关注AI工具与Agent动态的读者了解相关内容。
- 转发了: 话音刚落… — 即刻·莫唯书Mark 本条是对国内大厂做个人Agent相关内容的转发,涉及微信小微、字节豆包、阿里千问、小红书点点的布局现状、问题,指出国内大厂做个人Agent的核心门槛在生态打通、利益理顺等,梳理了国内AI Agent的发展困境与方向,适合关注国内AI产业动态的读者了解情况。
- 发布了: 飞书商业化招人,不同行业/不同城市/不同岗位都有,IC/Leader都有。 销售、售前、解决方案、效能顾问、客户发展、项目经理、技术运营、课程培训、学员运… — 即刻·陶晨毅_再减15斤 本条发布飞书商业化的招聘信息,涉及销售、售前、解决方案、效能顾问等多个岗位,覆盖不同行业、城市及IC、Leader层级,高意向者可约内推沟通,明确了飞书商业化的招聘需求,对有意向加入飞书商业化团队的求职者有参考价值。
- 发布了: 产模一体,最终还是要回归到DAU、留存、时长、营收的用户体验逻辑 — 即刻·莫唯书Mark 本条提出“产模一体”的核心逻辑,即最终要回归到DAU、留存、时长、营收的用户体验层面,强调用户体验在产品与模型结合中的重要性,明确了产模一体的核心方向,对理解AI产品的落地逻辑有参考意义。