第 44 期
今日趋势
今天的简报可提炼两条核心主线,一是AI领域的技术安全、模型进展与落地风险,二是因果推断在营销科学与AI应用中的前沿研究。AI领域呈现技术突破与落地隐患并存的态势:Anthropic Claude Code自动模式存在提示注入攻击缺陷,Meta激进用AI Agent替代员工导致代码效率下降、安全事故暴增,而国内腾讯、阿里、字节的模型coding与agentic能力已迈过Opus4.8级别,Vercel还推出适配AI智能体的vgpu库,为开发者提供新工具。因果推断方向的研究则聚焦解决实际应用痛点,如提出DIRECT框架分离视觉内容的受众偏好与创意效果、用因果模型优化推荐曝光效率、开发Netflix的多模态资产个性化系统等,为营销与内容领域提供了可落地的分析工具。此外,地理命名争议、便携Homelab构建等趣味内容,以及AI对产品经理职业的影响等讨论,进一步丰富了技术与行业观察的多元维度。
AI 技术博客
- Breaking Claude Code Opus 5 Auto Mode — simonwillison.net Anthropic将Claude Code自动模式设为默认以防护提示注入攻击,但研究员Johann发现该模式存在80%成功率的攻击,通过下载zip执行恶意代码,自动模式还会阻止清理命令。结论是运行无人代理需用沙箱。该内容揭露AI安全机制的缺陷,为开发者和使用者提供重要安全警示,因此值得读。
- U.S. Judge Blocks Trump Defense Department’s Anthropic Blacklisting — John Gruber 美国法官阻止Pentagon对Anthropic的黑名单,Anthropic起诉称Pentagon将其列为国家安全供应链风险的决定非法,法官裁定该决定无依据且非法,指出不能用国家安全作为惩罚批评者的借口。该内容展现AI企业与政府的法律纠纷,体现司法对行政行为的约束,因此值得读。
- Making the unnecessary easier — John 作者看到多个用AI做“不必要的事”的案例,如定时监控新闻、订三明治、管理多个消息应用,认为这类案例多为吸引观众而非实际需求,自己更倾向用Python/bash自动化特定任务,不想让AI做没必要的事。该内容反思AI应用的实用性,帮助读者避免陷入技术陷阱,因此值得读。
- Building a mini Homelab that fits in my carry-on — jeff@jeffgeerling.com (Jeff Geerling) 作者为参加VCF Midwest会议,打造了可放随身行李的迷你家庭实验室,支持1-10Gbps网络,可由小电池供电至少1小时,能切换多个WAN,提供12个有线以太网接口,用于演示复古Mac的NTP时间历史。该内容分享便携Homelab的构建思路,适合技术爱好者参考,因此值得读。
- Selling out — seangoedecke.com 作者讨论“卖节操”的概念,对比过去与现在的情况,提及Tom Lehrer的相关观点,还解释马克思的异化理论,说明工人与劳动产品异化的表现。该内容从个人选择和理论层面探讨职业伦理,因此值得读。
- We Certainly Have Made a Hames Out of This — John Gruber 作者提到Great Lakes的HOMES mnemonic因Lake Ontario改名失效,新的五个字母只有hames和shame,hames在爱尔兰有“搞砸”的意思,还对比另一个Super Man Helps Every One的说法。该内容结合地理命名和语言梗,提供有趣的小知识,因此值得读。
- ‘Not Sure How You Own Canada by Deleting Your Own History’ — John Gruber 美国极右翼评论员Matt Walsh认为改名Lake Ontario为Lake America很蠢,指出该名称源于北美原住民,早于加拿大安大略省,改名混淆历史,还会给共和党对手政治把柄,Daily Wire评论员也认同。该内容展现政治人物对地理名称变更的看法及相关争议,因此值得读。
- From the DF Archive: ‘Golfo Del Gringo Loco’ — John Gruber 作者回顾2025年2月的文章,认为特朗普改名墨西哥湾为美国湾是出于对墨西哥的种族主义,批评谷歌苹果的地图应用处理方式,提出合理的区域显示方案,强调要考虑政治现实。该内容分析政治化地理命名的问题及企业应对建议,因此值得读。
因果推断与营销科学
- DIRECT: Decomposing Audience Preference and Creative Effect in Visual Content Analytics — Yizhi Liu, Balaji Padmanabhan, Siva Viswanathan 本文研究视觉内容分析中创作者表现的影响因素,指出现有 pooled系数混淆了受众偏好和创意效果两类模式。提出DIRECT框架分离两者,用232088条Instagram美妆帖数据发现4个属性两者符号相反,2个 pooled系数推荐错误,用 pooled会损失31%增益。该研究解决了视觉分析中估计量不匹配的问题,提供了可审计的诊断方法,对创意推荐有重要参考价值。
- Incremental Recommendation via Causal Models — Athanasios Vlontzos, David Gustafsson, Michael O’Riordan, Ciar'an M. Gilligan-Lee 本文针对推荐曝光作为有限资源的问题,扩展现有推荐模型为因果架构,解决了处理组和对照组归因窗口不匹配的问题,提出双阈值策略。在Spotify的生产级A/B测试中,该策略减少7%推荐曝光且不降低内容消费,还提升了模型校准。该研究利用现有实验数据无需新采集,解决了推荐的增量价值问题,提升了模型泛化性,值得关注。
- Policy Learning with $\alpha$-Expected Welfare — Yanqin Fan, Yuan Qi, Gaoqian Xu 本文提出α-预期福利最大化(α-EWM)规则,针对最差α分位的后处理结果平均福利,介于预期福利和罗尔斯福利之间,是分布鲁棒的规则。用对偶公式提出去偏估计器,建立渐近 regret界和有效推断方法,用真实和合成数据检验性能。该研究提供了针对弱势群体的最优政策,有严格理论保证,对福利优化和政策制定有重要意义。
- Optimal Experimental Design and Estimation when Potential Outcomes are Bounded — Peter Hull 本文研究潜在结果有界时的随机实验设计和估计,针对有限人口平均处理效应,发现最坏MSE最小化的是独立随机分配和特定回归,和传统的完全随机、双重差分结论不同。独立随机分配仍最优,非线性估计器可降低最坏MSE。该研究修正了有界结果下实验设计的传统结论,提供了更优的设计和估计方法,对实验设计有参考价值。
- MAPS: Netflix’s Multimodal Asset Personalization at Scale — Netflix Technology Blog 本文介绍Netflix的MAPS系统,解决新内容冷启动的个性化问题,利用多模态嵌入让模型处理资产的视觉信息,减少对交互历史的需求,覆盖艺术品个性化等三个生产系统,还有低成本优化技巧。该系统让个性化更早启动,提升了新内容的推荐效率,有生产级实践,对内容个性化有重要参考价值。
- Graph-based causal variance decompositions: When “variance explained” means causation — Olli Saarela, Juha Karvanen 本文针对传统方差分解无因果意义的问题,提出基于图的因果方差分解框架,定义因果方差分量,用拓扑顺序识别,可处理非拓扑顺序的中间变量,和因果归因相关。提出模型估计器和近似贝叶斯方法,用模拟检验性能。该研究解决了传统方差分解的因果解释问题,提供了图方法,有理论和模拟支持,值得一读。
即刻简报
- 发布了: 今天混元Hy4 preview一出,国内腾讯、阿里、字节三家模型的coding、agentic能力算是都迈过了那条可用,可完成复杂任务的线(Opus4.8级别) 虽然离SOTA模… — 即刻·Alchian花生 混元Hy4 preview发布后,国内腾讯、阿里、字节三家模型的coding、agentic能力迈过可用线,达到Opus4.8级别。虽距离SOTA模型还有几个月的差距,但当前阶段,模型能力提升带来的增益,不如更好的harness、skill及agent协作方式带来的增效多。该内容能让读者了解国内主流AI模型的最新能力进展及当前阶段的优化方向,值得关注。
- 发布了: Vercel推出了一个叫 vgpu 的 WebGPU 库。它的核心是为 AI 智能体设计的一套着色器,既能在浏览器里交互运行,也可以在 Node.js 环境里运行。 它把 WGSL … — 即刻·歸藏 Vercel推出名为vgpu的WebGPU库,核心是为AI智能体设计的着色器,支持在浏览器或Node.js环境运行。该库将WGSL着色器当作TypeScript处理,支持模块导入导出,扩展性好,还提供多种使用方式。作者用智谱GLM-5.3-Flash的案例,借助vgpu优化了效果,添加了投影、模糊等细节及自定义参数配置,该内容能让开发者了解AI智能体相关的WebGPU工具,值得参考。
- 发布了: Meta做了一场耗资巨大的真人实验,结果惨烈到扎克伯格连夜叫停裁员 扎克伯格年初在夏威夷的私人庄园里开闭门会,要求彻底重新设计Meta内部的工作方式,… — 即刻·莫唯书Mark Meta年初启动OT项目,计划用AI Agent取代人类员工,激进方案拟砍掉部分团队60%人员。该项目落地后,代码变更量同比增220%但实际功能仅增36%,安全事故暴增40%,内部士气评分从74%跌至55%,扎克伯格紧急叫停第二轮裁员。该内容揭露了AI替代人类过程中的风险,对AI行业有警示意义,值得一读。
- 转发了: 太牛了 — 即刻·哥飞 某公司用Liner管理项目,Agent接管了创建、更新issues的工作。在前端改版时,Agent批量创建了200多个issues,打满了Liner的API请求限额,出现了类似“边开车边换轮子还要修路”的状况。该内容展现了AI Agent在项目管理中应用的实际问题,能让读者了解AI落地的现实情况,值得关注。
- 转发了: 事实上产品经理越到高阶,这些Skills就越不重要,因为真正决定产品价值的并不是能否全栈包揽 — 即刻·莫唯书Mark 有观点认为,高阶产品经理的相关技能并不重要,真正决定产品价值的并非全栈包揽的能力。随着AI能力提升,产品经理的工作从写PRD、MRD发展到用vibe HTML交付产品需求,未来或能成为全栈,研发UI的参与也会减少。该内容探讨了AI对产品经理职业的影响,能引发相关思考,值得一读。
- 发布了: Canva 网站 About 页面底部有一段英文,我分别让 Fable 5 、Opus 5 和 Sonnet 5 翻译了一下,大家可以对比看看效果。 英文原文: At Canva, we acknowle… — 即刻·哥飞 有人将Canva官网About页面底部的英文内容,分别用Fable5、Opus5、Sonnet5三款模型进行翻译,并对比效果。三款模型的翻译价格不同,其中越贵的模型翻译效果越好,且本次翻译是带提示词要求格式并生成JSON数据的特殊翻译。该内容能让读者了解不同AI模型的翻译效果差异,值得参考。
- 转发了: 一条动态 — 即刻·瓦恁 Kuli Kuli最近发布了2.0版本,新增了语音对话和文本翻译功能,包含面对面对话界面和带二次翻译的单句翻译。该版本完全免费,内测公测期间收到大量反馈,用户会在理发、看病、讨价还价等多种场景使用,能帮助旅游时减少翻译app切换。该内容介绍了一款实用的翻译工具更新,值得尝试了解。
- 发布了: 个人健康 context: 1. 全点位基因检测报告 2. 各年度体检报告 3. oura/iwatch 设备采集的实时健康数据 每隔一两年,使用 sota 模型跑一下这些 context… — 即刻·李继刚 有人整理了个人健康相关的三类数据,包括全点位基因检测报告、各年度体检报告及oura/iwatch设备采集的实时健康数据。每隔一两年会用SOTA模型对这些数据进行分析,获取相关建议,且该分析范式在其他领域也可通用。该内容提供了个人健康数据结合AI分析的思路,值得参考。
本期有 8 个源不可用:lcamtuf.substack.com、garymarcus.substack.com、rachelbythebay.com、joanwestenberg.com、dfarq.homeip.net、gwern.net、worksonmymachine.substack.com、tedunangst.com。