第 30 期
今日趋势
今天的内容主要涵盖两大主线,一是AI领域的产品动态与争议,二是因果推断与营销科学的实用研究进展。AI板块中,DeepSeek Harness开源、GLM-5.3升级安全与长程任务能力等产品发布,同时也出现了DeepSeek V4 Pro大幅涨价引发的性价比质疑,以及对DeepSeek Harness技术定位的分歧评价,既有技术创新的探索,也有产品落地的争议。因果推断与营销科学领域则围绕实际应用痛点,产出了离线评估可靠性、网络数据因果中介分析、A/B测试贝叶斯方法等多项研究成果,为从业者提供了明确的操作指南。此外,还有AI工具类的新应用,如帮助用户识别广告跟踪的DecryptAds服务、提升手机抗刮性能的Ceramic Shield技术,以及编码与几何交叉领域的研究,进一步拓展了AI技术的应用边界。
AI 技术博客
- llm-gemini 0.33 — simonwillison.net 该条目暂无具体内容,相关信息待补充。
- Hadamard Codes and Sphere Packing — John 本文介绍了Hadamard码在球填充领域的应用,基于Conway与Sloane提出的Construction A,二进制码可对应构造球填充。文中举例说明,(8,4,4)的Hadamard码能生成8维空间中最密的E8球填充,且该构造与标准E8同构。此外还提及Hadamard矩阵在NASA水手9号照片传输中的应用。本文清晰梳理了数学编码与几何球填充的关联,对理解交叉领域应用有帮助。
- sqlite-utils 4.2.1 — simonwillison.net 该条目介绍sqlite-utils工具的4.2.1版本,具体功能更新信息待补充。
- sqlite-utils 4.2 — simonwillison.net 该条目涉及sqlite-utils工具的4.2版本,详细功能细节待补充。
- Who’s Tracking You? Use This New Service to Find Out — BrianKrebs 本文介绍了一款名为DecryptAds的免费新服务,它通过爬取网站与应用公开的ads.txt、app-ads.txt等文件,关联广告技术数据,帮助用户快速了解跟踪自己的实体。该服务从安全视角切入,可用于定位恶意广告源、识别敌对国家的广告网络等隐私安全场景。它填补了广告技术领域隐私安全工具的空白,对用户保护个人数据有实用价值。
- Ceramic Shield 2 Is the Real Deal — John Gruber 本文围绕Ceramic Shield 2的抗刮性能展开,引用JerryRigEverything对iPhone17的测试,显示其在莫氏7级硬度下仅留轻划痕,优于普通玻璃。苹果官方测试也验证了其抗刮能力,作者自身使用的iPhone17Pro几乎无划痕,推测该屏幕是重要原因。本文通过实测和官方数据,证明Ceramic Shield 2的抗刮表现出色,对选购手机有参考意义。
- Pluralistic: Capital formation (14 Aug 2026) — Cory Doctorow 本文是2026年8月14日的Pluralistic专栏文章,核心探讨竞争的市场意义,指出无论是支持市场效率还是反对企业欺诈的视角,都需要市场竞争。若缺乏竞争,行业会形成寡头卡特尔,损害消费者与工人利益,还会俘获监管机构。本文从正反两方面分析竞争的重要性,对理解市场机制有启发。
- Edinburgh Fringe: Doris, Dolly and the Dressing Room Divas ★★★★⯪ — @edent 本文评价爱丁堡艺穗节的《Doris, Dolly and the Dressing Room Divas》演出,称其为精彩的歌舞秀,三位苏格兰女歌手演绎经典曲目,搭配精美服装道具,虽有小技术问题但演员表现出色。该秀是传统风格的歌舞 revue,在艺穗节众多高概念作品中别具特色,值得观众观看。
因果推断与营销科学
- When Can You Trust Offline Evaluation of Equal-Cost Top-k Allocation? A Controlled, Reproducible Benchmark and Practitioner’s Guide — Binshuang Li 本文探讨确定性top-k策略下离线评估的可靠性问题,构建了可控可复现的基准并提供从业者指南。通过在5个数据集和2组已知效应扫描上测试6种估计器,发现弱重叠与logger-target动作对齐相关,优化器诅咒无法通过交叉拟合解决,倾向估计误差是最大退化因素,还发布了公开数据的基准。该研究为部署前的策略评估提供关键参考,帮助从业者规避评估偏差。
- Optimal Experimental Design and Estimation when Potential Outcomes are Bounded — Peter Hull 本文研究潜在结果有界时随机实验的最优设计与估计,聚焦有限总体平均处理效应的估计。对比常用的完全随机分配与均值差估计,得出独立随机分配加特定回归的最坏情况均方误差更小,扩展到任意估计器仍成立,其增益相对其他设计可呈一阶效应。该成果改进了有界结果场景下实验的设计与分析,提升估计精度。
- Causal Mediation Analysis with a Time-Dependent Mediator, Time-Dependent Confounders and a Time-to-Event Outcome: Revisiting the Difference Method — Robin Denz, Nina Timmesfeld 本文针对带时间依存中介、混杂和时变结局的因果中介分析难题,通过模拟和真实数据对比差异法与参数化g-formula。发现Aalen模型的差异法在无治疗-混杂直接关系时无偏,Cox模型在罕见结局可用,AFT模型多有偏,仅g-formula在所有场景无偏。该研究为这类复杂场景的中介分析提供实用方法评估,指导从业者选择合适工具。
- Causal Mediation Analysis for Network Data with Graph Neural Network — Peikai Wu, Zhiguo Xiao 本文解决网络数据因果中介分析中无干扰假设不成立的问题,开发非参数框架,允许处理与中介溢出及高维网络混杂,用图神经网络学习高维干扰函数。模拟显示GNN估计器优于手工特征的机器学习方法,中国农险实验证实保险知识是核心中介通道。该方法突破了网络数据中介分析的限制,具有实际应用价值。
- Learning about Treatment Effects in Panels under Unknown Interference — Shengbin Wei 本文研究未知干扰下面板数据的处理效应识别,当干扰模式未知时无法分离处理效应与溢出。提出框架用凸权重的有效性边界加应用特定限制得到识别集,检验是否兼容有限线性系统,应用到亚利桑那工人法时无法确定效应符号。该成果为未知干扰的面板数据分析提供可行思路,解决实际应用中的识别难题。
- Bayesian Inference Procedures for A/B Testing: An Overview — M{\aa}rten Schultzberg, Mattias Fr{\aa}nberg 本文系统梳理A/B测试的贝叶斯推断方法,将配置分为三级:无误差控制的后验一致性、控制假阳性率的贝叶斯因子停止、控制错误发现率的经验贝叶斯。得出贝叶斯因子停止近最优,经验贝叶斯是第三级路径,不同风险对应不同方法,商业平台多在最低层。该概述帮助从业者理解贝叶斯A/B测试的特性,指导选择合适配置。
即刻简报
- 发布了: 15 张数据图帮你了解 DeepSeek Harness 昨天 DeepSeek Harness 发布,于是就想着让 Codex 分析一下,找到了一个很好的角度,就是从一些数据上向大家介绍… — 即刻·歸藏 本文介绍DeepSeek Harness发布后,通过Codex分析15张数据图得到核心信息,包括插件系统与Koishi相似度达75%、大量使用AI开发、参考Pi等外部Agent项目、65天产出84万行代码等关键数据。还提及UI从TUI改为双入口再到仅Web UI、测试与生产代码比例1:1等细节,发布20小时GitHub star破8万、附带88页论文。该内容能让读者快速掌握产品技术细节,值得一读。
- 发布了: GLM-5.3 发布了,看了一下,着重提升的主要是两部分: 1. 安全能力:看来 Hugging Face 在拿 GLM-5.2 防御了 OpenAI 的模型入侵以后,智谱也看到了这方… — 即刻·歸藏 本文介绍GLM-5.3模型发布的核心升级点,主要集中在安全能力和长程任务执行两方面。安全能力针对模型入侵防御做了优化,长程任务如终端操作、工具调用、大代码库修复的表现显著提升,且该模型仅通过后训练实现升级,未重新预训练。这能让读者快速了解智谱最新大模型的核心改进,值得一读。
- 发布了: Deepseek Harness 0.1 版本正式发布了,而且开源! 看起来主打的是他们那套插件系统,有点复杂。 https://github.com/deepseek-ai/deepseek-harness — 即刻·歸藏 本文提到Deepseek Harness 0.1版本正式发布并开源,该版本主打插件系统,但结构较为复杂,同时附上了项目的GitHub仓库链接。因内容简短,核心是告知该开源项目的发布情况,方便感兴趣的开发者获取项目资源,值得一读。
- 发布了: 来,作为一个 deepseek harness 喷子,我来告诉你它到底在捣鼓什么: 在 Claude Code、Codex 这类产品里,通常是: 固定 Agent 内核 + 可以添加的 Skill… — 即刻·赵纯想 本文以“喷子”视角分析DeepSeek Harness的架构,对比其他Agent产品,指出其采用极小内核加多插件的设计,实现了“时间可组合性”和“空间自愈”的插件特性,解决了Agent插件热插拔的稳定性问题,还提出“时空软件学”概念。该内容能让读者了解产品技术创新点与行业争议,值得一读。
- 发布了: deepseek harness 就是一帮技术人员主导之下制造出来的、产品层面的灾难。 你甚至能幻想出来技术人员在里面乐不思蜀、开发得如痴如醉的样子。 妄图插件… — 即刻·赵纯想 本文有观点认为Deepseek Harness是技术人员主导的产品灾难,试图靠插件生态形成差异化优势,对其相关AGI方向提出质疑。因内容简短,核心是呈现该产品的负面评价视角,能让读者了解行业对该产品的不同声音,值得一读。
- 发布了: DeepSeek Harness 有点像技术理想主义的玩具 模型发展这么快,要支持这么开放的系统 稳定性不可能好的 — 即刻·AGENT橘 本文有观点评价DeepSeek Harness是偏向技术理想主义的玩具,受模型快速发展的影响,其开放系统的稳定性难以得到保障。因内容简短,核心是呈现该产品的另一类评价视角,能让读者了解行业对该产品的多元看法,值得一读。
- 发布了: 真的无语了,DeepSeek V4 Pro 高峰期照着 12 倍去涨价… 太自信了… 这样的 Pro 毫无性价比 缓存命中输入 0.025 直接干到 0.30,12 倍。缓存未命中翻 3… — 即刻·AGENT橘 本文吐槽DeepSeek V4 Pro在高峰期涨价幅度大,缓存命中输入价格涨12倍、未命中涨3倍,还存在bug,部分场景表现不如旧版本Flash,性价比低。该内容能让读者快速了解该模型的价格与性能问题,值得一读。
- 转发了: B站的toy上架小游戏太方便了,全程交付给codex,只用点一次授权,支持打包的容量也很大!实在太厉害啦! — 即刻·海辛Hyacinth 本文转发了B站toy上架小游戏的体验,提到用Codex全程交付,仅需一次授权,打包容量大,效果出色,还附上了相关试玩链接。该内容能让读者了解B站toy的便捷使用体验和Codex的应用场景,值得一读。
本期有 9 个源不可用:lcamtuf.substack.com、garymarcus.substack.com、rachelbythebay.com、joanwestenberg.com、dfarq.homeip.net、gwern.net、worksonmymachine.substack.com、chiark.greenend.org.uk/~sgtatham、tedunangst.com。