第 5 期
今日趋势
今天简报围绕两条主线展开:一是苹果与OpenAI的贸易秘密诉讼博弈,双方在法律措辞和沟通细节上角力,苹果律师的失误与OpenAI的谨慎回应形成微妙对峙;二是Kimi K3以2.8T参数开源,性能逼近Opus级别,引发国内外对开源模型追赶速度的激烈讨论,甚至出现“时间机器蒸馏”的讽刺。值得关注的共性在于,无论是法律攻防还是模型竞争,各方都在用语言和参数规模争夺话语权;而分歧则体现在AI产品设计上——laper因模型“过于聪明”导致订阅率下降,与K3追求极致性能形成反直觉对照,提示用户心理与技术进步之间的复杂平衡。
AI 技术博客
- Dithering: ‘Apple Sues OpenAI’ — John Gruber 本文是Dithering播客的一期免费公开节目,讨论了苹果起诉OpenAI的案件。作者提出了与主流观点略有不同的看法,认为苹果的诉讼有其合理性。该期节目时长15分钟,每周两期,值得订阅。对于关注科技巨头法律纠纷的读者,这期节目提供了独特的分析视角。
- OpenAI Takes a Second Crack at a Response to Apple’s Trade Secret Theft Lawsuit — John Gruber OpenAI就苹果的贸易秘密盗窃诉讼发表声明,称“未发现任何证据表明投诉有依据”,但措辞微妙,与直接否认不同。这种回应显得谨慎且留有空间,暗示案件可能缺乏实质证据。文章指出这种表述与“投诉毫无依据”存在显著差异,值得关注法律博弈中的语言策略。
- Inkling: Our open-weights model — simonwillison.net 该条目仅包含标题“Inkling: Our open-weights model”,未提供正文内容。标题暗示这是一篇关于开放权重模型的介绍或发布公告,但缺乏具体细节。对于关注开源AI模型的读者,可能需要进一步查找原文以获取完整信息。
- Quiche Browser Now Defaults to No-AI Web Search Results — John Gruber Quiche浏览器宣布默认禁用AI搜索摘要,转而使用无AI版本的搜索引擎(如Google、DuckDuckGo等)。作者认为这一做法能节省用户时间,保护真实网站链接不被AI内容淹没。该功能可在设置中重新开启,体现了对用户选择的尊重。这是对抗“死互联网理论”的务实举措,值得其他浏览器效仿。
- OpenAI Releases Codex Micro, a Stupid $230 Hardware Keypad — John Gruber OpenAI发布了一款售价230美元的硬件键盘Codex Micro,用于配合其编程工具。文章讽刺此举是“愚蠢的副业”,与公司此前强调聚焦核心产品的表态矛盾。作者引用评论称,使用笔记本电脑自带的键盘和触控板即可免费完成相同工作。这一产品引发对OpenAI战略方向的质疑。
- Kimi K3, and what we can still learn from the pelican benchmark — simonwillison.net 该条目仅包含标题“Kimi K3, and what we can still learn from the pelican benchmark”,未提供正文内容。标题提及Kimi K3模型和鹈鹕基准测试,可能涉及模型性能评估或学习经验。对于关注AI基准测试的读者,建议查阅原文以获取具体分析。
- Lawyer for Apple Mixed Up Two OpenAI Employees’ Names, Sent One Email to the Wrong Guy, Back in February — John Gruber NBC新闻报道称,苹果律师在2月因混淆两名OpenAI员工的名字(Wang和Chang),将邮件误发给错误的人,导致沟通中断。尽管律师次日道歉,但OpenAI总法律顾问要求更换律师,苹果拒绝。文章认为这一失误并不严重,不足以反驳苹果关于OpenAI未回应的指控。事件揭示了法律沟通中的细节重要性。
- Art Doesn’t Scale — Mathew Duggan 作者在哥本哈根咖啡馆听到一场关于AI艺术是否算“艺术”的争论:一位科技从业者认为AI生成作品与手工艺术在情感上等价,而艺术家则视其为对多年练习的冒犯。作者作为技术使用者兼艺术爱好者,理解双方立场,但认为AI无法替代艺术创作中的人性投入。文章反思了效率与热情之间的根本冲突,值得所有参与AI讨论的人阅读。
因果推断与营销科学
- Accelerating A/B-Tests with Counterfactual Estimation: Reducing Variance through Policy Overlap — Olivier Jeunen 本文提出利用策略重叠加速A/B测试的新方法,通过Δ-Off-Policy Estimation获得无偏处理效应估计。理论证明该方法方差随策略分歧而非原始结果方差变化,在策略有共同支持时严格优于标准差异均值估计量。实证结果验证了理论优势。该工作对推荐系统、信息检索和大语言模型接口的在线评估具有重要实践价值。
- Empirical stratification for predictive treatment effect heterogeneity with post-treatment variables — Chao Cheng, Rui Wang, Yichi Zhang 本文提出利用后处理变量预测处理效应异质性的经验分层框架,通过基线协变量预测的潜在后处理响应构建经验评分,定义可解释的亚组。引入投影ETE曲线和基于有效影响函数的估计量,允许灵活估计 nuisance 参数。模拟和实际应用验证了方法的有效性。该框架为理解处理效应的个体差异提供了新工具,尤其适用于存在治疗依从性等后处理变量的场景。
- Making Event Study Plots Honest: A Functional Data Approach to Causal Inference — Chencheng Fang, Dominik Liebl 本文提出一种函数数据方法改进双重差分中的事件研究图,使其能提供诚实的因果推断。估计量在连续函数空间中收敛到高斯过程,可构建强大的同时置信带。通过预处理期的等价检验验证参考带,后处理期的相关性检验验证因果效应。模拟和案例研究展示了方法的性能。该工作为事件研究图提供了严格的统计基础,避免因平行趋势假设失败导致的误导性结论。
- Learning Who to Treat When Treatment is Missing — Johnna Sundberg, Rayid Ghani, Eli Ben-Michael, Edward Kennedy 本文研究治疗数据缺失下的策略学习问题,将平均处理效应的高效估计扩展到策略价值和条件平均处理效应估计,适用于随机缺失和完全条件随机缺失机制。理论证明在完全条件随机缺失下,利用部分观测单元的MAR估计量更有效。实验表明正确指定缺失机制至关重要,而本文估计器在假设满足时接近最优。该工作为实际中常遇的治疗缺失问题提供了理论严谨且经验验证的稳健工具。
- Generative Synthetic Data for Causal Inference: Pitfalls, Remedies, and Opportunities — Yichen Xu 本文揭示完全生成式合成数据(如GAN、LLM)在因果推断中的结构性缺陷:它们可能保持预测效用但扭曲平均处理效应。提出混合合成数据框架,分别生成协变量并建模处理与结果机制,避免因果对比失真。实验表明混合合成在因果保真度上优于完全生成式方法,并在ACTG应用中提升了预测保真度。该工作为使用合成数据进行因果推断提供了重要警示和实用解决方案。
- Probability of worthwhile effect of monotone-response treatments — Benjamin C^ot'e, Ruodu Wang 本文在单调处理响应假设下(处理效应非负),研究处理效应超过给定阈值的最佳和最差概率。通过显式构造依赖方案给出解析解,该问题等价于依赖不确定性下的风险聚合和特定成本函数的最优传输。该工作为无法观测联合分布时评估处理效应提供了理论边界,适用于临床试验等场景。
即刻简报
- 发布了: 藏师傅的 Kimi K3 测评来了,这次确实非常牛逼! 可以说是一个比较小的 DeepSeek 时刻 我直接拿它跟 Opus 4.8 做了对比测试。 从结果来看,互有胜负。 … — 即刻·歸藏 该测评对比了Kimi K3与Opus 4.8在四个前端任务上的表现。关键结论:视频理解复刻3D玻璃棱镜K3胜出,贝塞尔光带平手,视差滚动卡片和家具动效Opus小胜。K3具备多模态理解和自我截图修正能力,且价格仅为Sonnet级别。值得读是因为它展示了开源模型在复杂前端领域逼近顶尖闭源模型的实力,性价比突出。
- 发布了: 过于聪明的模型使laper的首日订阅率下降3倍。 在我们猜测了多个参数之后,决定将一切复原。 周日订阅率回升到之前的水平。 反直觉:创意辅助类Agent,模… — 即刻·赵纯想 该动态指出,过于聪明的模型导致laper首日订阅率下降3倍,恢复设置后订阅率回升。作者认为创意辅助类Agent中,模型做到60分用户踏实,做到85分用户反而难以接续。这一反直觉现象揭示了AI产品设计中用户心理的微妙平衡,值得产品经理和AI开发者深思。
- 发布了: Codex 昨晚的更新在交互上终于对味了: 1. 左上角的切换:从 Work 和 Codex 切换成 ChatGPT 和 Codex 2. 历史聊天整合:ChatGPT 的历史聊天全部并进了左… — 即刻·歸藏 Codex昨晚更新了交互设计:左上角切换改为ChatGPT和Codex,历史聊天整合进左侧并支持筛选,顶部导航分为Chat和Work两个Tab。这些改动使交互逻辑与网页版和移动端一致,提升了使用流畅度。值得读是因为它展示了AI工具在用户体验上的持续优化方向。
- 发布了: 现在国内模型的商单越来越不好接 聪明的读者喊出了 “不要看,他说什么模型好,要看他自己花钱买了什么模型,每天用什么模型。” 现在Agent榜单,更加可… — 即刻·AI产品黄叔 作者指出国内模型商单越来越难接,聪明的读者更关注创作者实际使用的模型而非广告。因此作者计划降低商单收入比例,转向卖社群以增强粘性。这一观点反映了内容创作者在AI评测领域的信任危机和商业模式转型趋势,值得关注行业动态的人阅读。
- 发布了: 昨晚 Kimi K3 发布后,我看到参数量真的很意外,K3 的模型参数已经来到了 2.8T,我原以为这个参数规模的开源模型,要等到 Q4 才会有,因为这是很多国内… — 即刻·AGENT橘 文章分析了Kimi K3的2.8T参数量,认为其已达到Opus级别,将中国开源模型与一线模型的差距缩短至半年左右。关键结论:K3有望全面对齐Opus,且训练超大参数模型需要巨额资金和试错成本。值得读是因为它揭示了中国大模型在参数规模上的里程碑突破,以及追赶世界顶尖水平的实际进展。
- 发布了: 有人羡慕我做 YouMind 两年 居然还没 pivot(换方向) 其实只是因为我是 80 后 很谨慎 如果我是 00 后 两年应该已经 pivot 三次 幸运的是 YouMind 确实… — 即刻·玉伯 作者自嘲作为80后创业谨慎,YouMind两年未换方向,而00后可能已pivot三次。幸运的是YouMind确实无需pivot,并用精灵配图展现抽象趣味。这一动态以幽默方式表达了创业坚持与自我认知,值得创业者品味其中的心态与策略。
- 发布了: 我的推特时间线上已经全是 Kimi K3 了 估计 Anthropic 达里奥又要气疯了,可能今天晚上又得发一篇博客来强调开源模型的危害了 之前很多海外的人,一提到… — 即刻·歸藏 推特上Kimi K3引发热议,预计Anthropic的达里奥会再次强调开源模型危害。海外评论讽刺称中国人造了时间机器从未来蒸馏模型,以回应此前对中国模型蒸馏的指责。这一动态反映了开源模型竞争中的舆论博弈,值得关注AI行业国际动态的人阅读。
- 发布了: 太震惊了,Kimi K3 竟然是一个超大的 2.8T 的开源模型。 2.8 T 这个参数量可能已经超过了 Opus…照着 Fable 去了 这是很多国内公司在下半年的计划…现… — 即刻·AGENT橘 Kimi K3以2.8T参数量开源,可能已超过Opus,直指Fable级别。这一规模原本是许多国内公司下半年的计划,如今Kimi提前完成。中国开源模型与一线模型的差距可能已缩小到6个月内。值得读是因为它标志着中国大模型在参数规模上取得重大突破,具有里程碑意义。
本期有 8 个源不可用:lcamtuf.substack.com、garymarcus.substack.com、rachelbythebay.com、joanwestenberg.com、dfarq.homeip.net、gwern.net、worksonmymachine.substack.com、tedunangst.com。