第 11 期
今日趋势
今天的简报围绕两条主线展开:一是AI技术能力的边界与认知冲突,例如LLM面对知识截止日期外的信息会陷入逻辑悖论,同时Flux 3、Kimi K3等新模型在视频生成和动效复刻上展现了惊人进步,但AI生成内容的空洞和AI泡沫的批判也提醒我们技术远未成熟;二是人类专业知识与AI协作的深度,多篇文章强调与LLM高效交互需要领域专长(如数学家Tao的案例),而个人通过AI突破自身上限的实践(如skillOS进化)则印证了工具与人的双向赋能。值得关注的共性在于,无论是对AI失控的质疑还是对开放源码维护者孤独奉献的致敬,都指向一个核心分歧:AI既被寄予厚望,又被要求直面其不可靠性与经济泡沫的代价。
AI 技术博客
- LLMs break down in funny ways when told the Jacobian Conjecture counterargument — minimaxir.com Anthropic研究员用Claude发现了悬而未决80年的Jacobian猜想反例,并验证为真。有趣的是,当把这个反例输入给LLM时,它们会因知识截止日期前的认知矛盾而陷入逻辑悖论,表现出类似“崩溃”的行为。这一现象揭示了LLM在面对自身知识库之外的确认信息时,会产生有趣的认知失调,是AI逻辑炸弹的现实案例。
- LLMs reward expertise — seangoedecke.com 文章指出,与LLM高效交互的关键并非提示技巧,而是领域专长。以数学家Terence Tao为例,他通过简短精准的提示与ChatGPT进行高水平数学讨论,而普通人难以复制。核心结论是:专业理解能引导模型进入专家模式,获得更高质量输出。值得一读,因为它颠覆了“人人都会用LLM”的认知,强调了深度知识的重要性。
- Have you read it? — rss@idiallo.com AI生成的文章之所以糟糕,是因为作者(AI)和读者同时首次接触内容,作者并未真正思考。文章缺乏深度,读者无法追问,因为背后没有真实的人类思考过程。核心观点犀利:AI文章没有“作者”,所以空洞无物。值得读,它一针见血地指出了AI内容创作的根本缺陷。
- Pluralistic: AI solipsists and AI cynics (24 Jul 2026) — Cory Doctorow 文章认为AI作为技术并不特殊,但作为经济泡沫则异常庞大。AI公司已花费超1.4万亿美元,承诺大规模失业,但AI实际无法胜任取代的工作,且导致环境破坏。关键结论:AI泡沫建立在产品降级和经济垄断之上。值得读,它对当前AI投资热潮提供了冷静的批判性分析。
- The first known runaway AI agent - or a very bad marketing stunt? — simonwillison.net 标题提出的问题:这是首个已知的失控AI代理,还是恶劣的营销噱头?虽然原文空白,但核心聚焦于AI安全与真实性的边界。事件本身引发对AI自主行为是否被夸大的讨论。值得读,它促使人们思考AI失控案例的真实性与炒作之间的关系。
- Interview with a Maintainer — Andrew Nesbitt 播客采访了libcapstan库的维护者Erin Marsh,她独自一人承担每月8000万次下载和4万多个依赖包。从2019年接手至今,其他维护者已离开。访谈揭示了开源维护者孤独而奉献的日常。值得读,它让读者看到支撑互联网基础设施的无名英雄的真实故事。
- John Dvorak on Computer Chronicles in 1987 to Discuss the Then-New IBM PS/2 — John Gruber 回顾1987年John Dvorak对IBM PS/2的评论:他认为PS/2技术先进(无缆线组装),但会在市场中输给廉价杂乱的PC。这一预测后来被证实。核心观点是技术优越性不保证市场成功。值得读,它提供了历史视角,思考技术、市场与商业策略的关系。
- Making an agile version of a Windows Runtime delegate in C++/WinRT, part 4 — Raymond Chen 本文介绍在C++/WinRT中优化敏捷委托的上下文比较方法:使用CoGetContextToken获取整数令牌比较,避免COM对象开销。但需注意上下文存活时间,否则令牌可能重用。关键结论是整数比较更高效,但仍有缺陷。值得读,它是Windows运行时开发者的实用性能优化技巧。
因果推断与营销科学
- Identification and Robust Inference for Multiple Treatment Effects with Possibly Invalid Instruments — Ziwei Mei, Qingliang Fan, Zijian Guo 本文研究线性工具变量模型中多个内生处理和可能无效工具的问题。提出广义多数规则用于识别多个处理效应,并构造了抽样置信区间以应对工具选择错误导致的覆盖不足。该方法在孟德尔随机化应用中验证了有效性。值得读是因为它解决了多个处理效应下工具变量选择错误的稳健推断问题,具有实际应用价值。
- CEDAR: Causal Edge Discovery for Autoregressive Processes — Mohammad Fesanghary 提出CEDAR方法,一种基于约束的滞后因果边发现算法,适用于稀疏自回归时间序列。通过AR(1)残差化的U中心距离相关筛选候选滞后,再进行条件独立性检验,在稀疏情况下仅需O(d^2)次检验。该方法在数据稀缺且变量具有滞后1自动力学时最有效。值得读是因为它为短时间序列因果发现提供了高效且可解释的方案。
- GAUGER: Generalized Regression Adjustment via Graph-Weighted Exposure-Level Residualization for Design-Based Inference Under Interference — Lei Shi, Rita Lyu, Sizhu Lu 提出GAUGER框架,用于网络干扰下的设计因果推断。揭示预测误差最小化与方差减少之间的不匹配,并设计两步法:先用强预测模型学习模式,再用图加权暴露水平残差化直接减少方差。数值研究表明效率显著优于现有方法。值得读是因为它解决了网络干扰下因果估计的方差减少难题,提供了实用工具。
- On the Granularity of Causal Effect Identifiability — Yizuo Chen, Adnan Darwiche 考虑基于状态的因果效应可识别性,与传统的基于变量可识别性不同。证明状态效应可能在变量效应不可识别时仍可识别,但需要上下文特定独立性等额外知识。提出在这些约束下识别因果效应的方法。值得读是因为它细化了因果效应可识别性的概念,揭示了更精细的识别条件。
- Using Pre-Trends for Inference in Difference-in-Differences — Cl'ement de Chaisemartin 提出一种利用预处理趋势作为参考分布进行双重差分推断的简单程序。该程序与现有符合推断程序相关,但不需要平行趋势假设,而是直接使用预处理趋势信息。值得读是因为它放松了双重差分的关键假设,在多个预处理时期时提供了更灵活的推断方法。
- Robust Signal Maximization in Spillover Experiments — Kirill Borusyak, Peter Hull, Evan Munro 研究溢出实验的最优设计和分析,以最小化最坏情况渐近方差。设计问题得到直观解:在信号强度与变异扩散间权衡;分析问题得到简单重中心工具变量估计量。在半合成实验中标准误降低50-100%以上。值得读是因为它为溢出实验提供了稳健且高效的设计和分析框架,具有显著效率提升。
即刻简报
- 发布了: Codex 更新了,现在你可以在 Codex 里直接使用 GPT Live 实时的语音模型。 相较于手机端来说,这个体验简直太爽了! 你完全可以脱离键盘等任何输入设备… — 即刻·歸藏 Codex更新集成了GPT Live实时语音模型,用户可完全脱离键盘,通过语音与Codex交互并执行命令。关键体验:佩戴耳机即可在家任意位置对话,甚至在上厕所时也能掌握进度。本文值得一读,因为它展示了AI交互从键盘到语音的飞跃,预示了未来“纯语音编程”的便捷可能。
- 发布了: 果然发布了! Black Forest Labs 发布和开源 Flux 3 视频生成模型,功能非常强大: 1. 基础生成:支持文生视频、图生视频(可以把图片作为参考,也可以… — 即刻·歸藏 Black Forest Labs发布并开源Flux 3视频生成模型,支持文生视频、图生视频、视频参考生成、音频延长、关键帧控制等八大功能。模型将先开放API,后续开源Flux 3 Dev版本。本文值得关注,因为Flux 3在视频生成的多样性和控制力上达到新高度,开源将推动社区创新。
- 发布了: Kimi K3 太牛逼了! HyperFrame 团队用 Kimi K3 复刻了一个非常有名的动效设计师团队的动效视频,还原度非常高。 而且他们的风格非常独特,其实挺难做的… — 即刻·歸藏 HyperFrame团队用Kimi K3成功复刻了知名动效团队的复杂视频,还原度极高。此前该动效团队曾断言Kimi K3无法完成此类作品。本文值得一读,它用实例证明了AI在动效设计领域的惊人潜力,打破了专业团队的认知局限。
- 发布了: 经历漫长的煎熬和探索,我的skillOS终于阶段性进入evolutionOS了,终于又可以是AI狂奔带着我的状态,而不是我是上限和卡点了。 复利工程探索了这么久,… — 即刻·余一.Dev 作者宣布其skillOS系统阶段性进入evolutionOS,终于摆脱自身上限,让AI引领前进。这是长期复利工程探索的成果。这条动态值得关注,它反映了AI时代个人成长与工具协同的新模式,给同样在探索的人以鼓舞。
- 发布了: 这是我看过的 写梁文锋最好的一篇文章 — 即刻·玉伯 作者推荐一篇关于梁文锋的文章,称其为“最好的一篇”,并感叹梁文锋的独特性。虽然未提供具体内容,但推荐本身暗示了文章对梁文锋的深度剖析。值得一读,因为梁文锋是AI领域重要人物,好文章能帮助理解其思想。
- 发布了: 这是我最近半年看过的,最好笑的文章 。哈哈哈哈😂🤣 — 即刻·文兄MattWen 作者分享了一篇半年内最好笑的文章,内容是Claude Fable不带脏字地嘲讽GPT和奥特曼全家。文章幽默犀利。值得一读,因为它以独特方式展现了AI圈内的趣味互动,能带来轻松一笑。
- 发布了: Opus5 模型可能今晚发布 — 即刻·歸藏 消息称Opus5模型可能于今晚发布。目前尚无更多细节。这条动态值得关注,因为Opus系列是重要模型,新版本发布可能带来性能突破,对AI社区有即时影响。
- 发布了: 哈哈哈哈,我让ai画一张快乐小狗,还怪可爱的呢,我一定要分享一下 — 即刻·余一.Dev 作者用AI生成了一张快乐小狗的图片,觉得可爱并分享。内容简单,但体现了AI绘画的趣味性和日常应用。值得一看,因为它展示了AI在创意娱乐中的轻松一面,适合放松心情。
本期有 8 个源不可用:lcamtuf.substack.com、garymarcus.substack.com、rachelbythebay.com、joanwestenberg.com、dfarq.homeip.net、gwern.net、worksonmymachine.substack.com、tedunangst.com。