第 29 期
今日趋势
近期AI领域呈现产业动态、应用探索与学术突破并行的态势,其中一条主线是大模型赛道的变化,DeepSeek V4 Pro 0813版本发布后因定价调整、发布不透明等问题引发用户关注,SpaceX AI推出的Grok 4.6则以适中定价和便捷桥接特性吸引使用,但多Agent场景下内存占用过高的问题也暴露了部署痛点。另一条主线是AI在消费电子、文化娱乐等领域的应用及争议,谷歌Pixel11系列依托Gemini的代理AI功能主打订杂货、叫车等消费场景,而AI训练的脱口秀演出却因内容老套、冒犯观众被差评,谷歌设计社交账号的内容也引发了审美与管理争议。因果推断与营销科学领域近期多项研究突破了传统方法局限,在结构化结果因果推断、逆混杂分析、亚组治疗效应估计等方向提供了更精准的推断框架,为相关领域的研究和应用提供了新工具。
AI 技术博客
- DeepSeek V4 Pro 0813 (on OpenRouter) — simonwillison.net 暂无有效内容,无法提炼核心观点
- TechCrunch on Google’s Pixel 11 Lineup — John Gruber 这篇TechCrunch的文章介绍谷歌Pixel11系列主打代理AI功能,依托Gemini可帮用户完成订杂货、叫车、预约等任务,用户可随时接管或停止AI操作。首批适配的应用含OpenTable等,但OpenTable仅英国支持。作者评价Pixel系列和安卓又有亮眼表现,值得关注AI在消费电子中的应用进展。
- Edinburgh Fringe - Garrett Millerick: We Tried it Your Way ★☆☆☆☆ — @edent 这篇是爱丁堡艺穗节对Garrett Millerick脱口秀的差评,称其是看过最差的演出。该演出用AI训练内容,AI版本很无聊,本人也刻薄,冒犯观众,内容老套,观众尴尬。作者认为AI喜剧是作弊,喜剧演员不用太担心,有机 routine也差,值得看差评了解艺穗节演出质量。
- alchemy-utils 0.1a0 — simonwillison.net 暂无有效内容,无法提炼核心观点
- Quoting Florian Herrengt — simonwillison.net 暂无有效内容,无法提炼核心观点
- Google Design Pisses Its Pants on Twitter/X — John Gruber 这篇讲谷歌设计的Twitter/X账号发布内容,作者觉得像初中生黑客所为,担心有人类设计师认可该内容的比例和审美。原推文链接有动画展示UI,可通过修改域名查看镜像。该事件反映谷歌设计的争议,值得关注品牌社交账号的内容管理。
- Joanna Stern on the Pixel 11 ‘HiLight’ Notification Light — John Gruber 这篇是Joanna Stern对Pixel11 HiLight通知灯的评价,作者怀念黑莓的通知灯,HiLight可给VIP设颜色,翻过来能识别来电,但仅支持电话,作者不用翻手机觉得没用,对比苹果。该内容反映手机通知功能的设计,值得看用户对新功能的真实体验。
- Google Introduces ‘Camera Looks’ With Pixel 11 Phones — John Gruber 这篇The Verge的文章介绍谷歌Pixel11的Camera Looks功能,针对不同用户对照片的需求,推出传感器级处理工具,类似苹果Photographic Styles但有 grain控制,作者喜欢 grain,常用第三方APP。该功能解决照片风格差异问题,值得关注手机相机的个性化处理进展。
因果推断与营销科学
- Causal inference for group-contaminated structured outcomes: observable quotients, lossless reduction and exact randomization inference — Usef Faghihi, Amir Saki 本文研究受未知单位特异性变换(如显微镜图像)影响的结构化潜在结果的因果推断,区分观测性与统计无损性,提出商忠实重构定理,分离不同作用类型并说明分量规范化的信息损失。模拟及RxRx1研究显示,零假设下拒绝率0.052,单位效应强度功效0.992,主对比p值0.0078。该研究解决了变换导致的生物效应与采集几何混淆问题,提供精确推断方法,值得关注。
- Inverse Confounding Analysis: An Exact Method for Quantifying the Significance of Confounding — Sergey Porotsky 本文针对观察性数据未测量混杂导致的暴露-效应估计偏差问题,提出逆混杂分析(ICA)方法,用于量化混杂的显著性,而非现有方法的最坏情况边界。ICA扩展了E值,通过逆问题重构所有可接受联合分布,将风险比参数化为单自由参数的分数线性函数,可推导精确分析量。该方法突破了现有敏感性分析的局限,提供更全面的混杂评估,具有重要应用价值。
- Doubly Robust Targeted Estimation of Subgroup Average Treatment Effects for Time-to-event Outcomes with Competing Risks — Runjia Li, Victor B. Talisa, Chung-Chou H. Chang 本文针对竞争风险下时间-事件结局的亚组平均治疗效应(ATE)估计问题,提出基于累积发病率和靶向最大似然估计(TMLE)的新框架,适用于脓毒症ICU患者等场景,兼具渐近效率与双重鲁棒性。推导了亚组ATE的有效影响函数,经模拟验证,还开发了变量重要性测度以识别效应异质性。该工具助力精准医疗中个性化治疗策略的优化,值得一读。
- Debiased Causal Mediation Analysis in Ultra-High-Dimensional Settings in the Presence of Interaction Effects — Shi Bo, AmirEmad Ghassami, Debarghya Mukherjee 本文解决超高维下带交互效应的因果中介分析难题,针对高维中介与协变量的情况,提出多步去偏估计方法,处理治疗-协变量、治疗-中介等交互作用,证明估计量√n一致且渐近正态,可有效推断自然直接与间接效应。经模拟及TCGA肺癌数据验证,分析吸烟经DNA甲基化对肺癌生存的影响,突破高维中介分析局限,适合组学等数据,具有重要方法学意义。
- Efficient Response-Adaptive Randomization for Multi-arm Trials with Prioritized Composite Endpoints — Ayon Mukherjee 本文扩展高效响应自适应随机化设计至多臂试验的优先复合终点场景,针对无法简化为单终点的疗效+安全性等优先终点,基于广义成对比较的净获益构建设计,证明分配比例的强一致性、渐近正态性,达到半参数效率界。模拟显示其比单终点设计更高效分配至优效治疗,保持I类错误与功效,适用于III期试验,符合监管要求,值得关注。
- Semiparametric Inference for Half-Trek Estimators in Linear Structural Equation Models — Leopold Mareis, Nils Sturma, Mathias Drton 本文针对线性结构方程模型中半程准则(HTC)识别的结构系数,推导其半参数推断方法,得到HTC估计量的半参数影响函数,证明其渐近正态性且方差可闭式计算,提供置信区间与假设检验。应用于富尔顿鱼市场数据,得到供应对需求因果效应的完整推断,完善了HTC估计的统计推断,解决了此前缺乏标准误等问题,具有方法学价值。
即刻简报
- 发布了: 万众期待!DeepSeek V4 Pro 0813 正式版发布 从指标看,有两项指标 超越 Fable,多项指标超越 Opus 4.8 Fable 依然是当下难以逾越的高山 但 V4 Pro 比 F… — 即刻·AGENT橘 本文介绍DeepSeek V4 Pro 0813正式版发布的消息,该模型在两项指标上超越Fable,多项指标超越Opus 4.8,不过Fable仍是难以逾越的高山。关键结论是V4 Pro性价比突出,比Fable便宜100倍(涨价前)。值得读的是能了解最新大模型的性能与价格优势,对选型有参考价值。
- 发布了: V4 Pro 0813 的正式更新公告来了,同时涨价额度也确定了。 看来下午的 V4 Pro 0813 模型是有点不对,现在他们正式发了更新公告,这次估计是没啥问题了。… — 即刻·歸藏 本文说明DeepSeek V4 Pro 0813正式更新公告发布,同时确定涨价额度,采用峰谷定价模式。峰值时段该模型输出价格比原来贵4倍多,空闲时段贵一倍多,此前下午的模型问题已解决。关键结论是该模型定价调整,峰谷差异大,成本变化需关注。值得读的是能掌握该模型最新定价规则,避免使用时成本超支。
- 发布了: DeepSeek V4 Pro 正式版 0813 发布了! 从流传的测试成绩来看依然相当爆炸 — 即刻·歸藏 本文发布DeepSeek V4 Pro正式版0813的消息,提到从流传的测试成绩来看,该模型的性能表现相当爆炸。关键结论是该模型测试成绩亮眼,性能达到较高水平。值得读的是能快速了解该模型的性能表现,为使用或选型提供参考。
- 发布了: DeepSeek V4 Pro 的 0813 版本不太对劲,他们是不是又把模型给撤了? 现在的情况非常奇怪: API 确实是有的,在 API 的模型和价格这部分写的是 0813,但… — 即刻·歸藏 本文指出DeepSeek V4 Pro 0813版本存在异常,API标注该版本但更新日志无相关内容,官网横幅被撤,测试得分仅比V4 Flash高1分,官方未发布正式公告。关键结论是该版本发布不透明、测试成绩异常,引发用户质疑。值得读的是能了解该模型发布中的异常情况,避免踩坑。
- 发布了: SpaceX AI 发布了 Grok 4.6 模型,然后价格还行,每百万输入输出分别为 2 和 6 美元。 当然,如果你有 Twitter 的 Premium+的会员的话,依然可以通过 Gr… — 即刻·歸藏 本文介绍SpaceX AI发布Grok 4.6模型的消息,该模型每百万输入输出价格分别为2和6美元,Twitter Premium+会员可通过Grok Build授权白嫖。关键结论是该模型定价适中,会员有免费使用渠道。值得读的是能了解该模型的价格与使用方式,适合相关用户参考。
- 发布了: Grok 4.6快的飞起,也非常强 那能不能在WorkBuddy里调用Grok 4.6呢 我问了下Grok 有一个方式很简单 一行命令完成安装: npx skills add zjp1997720/zhij… — 即刻·AI产品黄叔 本文说明Grok 4.6性能强速度快,可通过一行命令安装桥接至WorkBuddy,使用时额度消耗较快,但执行速度比Codex快很多。关键结论是该模型可便捷桥接至WorkBuddy,性能速度优势明显。值得读的是能掌握该模型的使用方法与性能特点,提升工作效率。
- 转发了: 流传的截图,说是 DeepSeek Harness 会在今天公测,不是要跟 0813 的模型细节一起发布吧 — 即刻·歸藏 本文提到流传截图称DeepSeek Harness今日公测,可能与0813模型细节一同发布,还转发了相关内容。关键结论是DeepSeek Harness今日公测或同步模型细节,引发关注。值得读的是能了解DeepSeek相关工具的公测信息,及时跟进动态。
- 发布了: Agent稍微一多,内存就爆 下一台必须要加内存了 哎 — 即刻·AI产品黄叔 本文指出Agent数量较多时内存占用过高,需升级内存。关键结论是多Agent场景下内存压力大,需硬件升级。值得读的是能了解多Agent运行的内存问题,为部署提供参考。
本期有 9 个源不可用:lcamtuf.substack.com、garymarcus.substack.com、rachelbythebay.com、joanwestenberg.com、dfarq.homeip.net、gwern.net、worksonmymachine.substack.com、chiark.greenend.org.uk/~sgtatham、tedunangst.com。