第 43 期
今日趋势
今天的内容主要围绕AI技术与应用、因果推断研究两大主线展开,前者涵盖大模型迭代、工具更新、安全实践及商业化路径探讨,后者聚焦各类因果分析方法的创新以解决复杂场景下的估计难题。AI领域中,开源多模态模型Qwen3.8-Flash-Next、高性价比模型GLM-5.3 Flash的推出,以及Codepilot工具的功能优化,体现了技术落地与用户需求的紧密结合,同时关于动态UI生成是否必要的分歧,也反映了产品设计中用户体验与技术创新的平衡问题。因果推断领域的多项研究分别针对网络实验、双重差分、匹配研究等场景的现有局限,提出了更具适配性的新方法,为复杂数据下的政策评估与营销分析提供了可行方案。此外,网络犯罪集团TeamPCP被逮捕、欧盟新监管规则对小微企业的冲击、苹果地图广告上线及小公司Panic的关税退款等动态,从不同维度展现了科技与商业、监管的互动与博弈。
AI 技术博客
- Qwen3.8-Flash-Next — simonwillison.net Qwen3.8-Flash-Next是Qwen推出的开源权重模型,属于多模态混合专家(MoE)模型,也是“a multimodal MoE model”,同时是Qwen4架构的早期预览。该模型总参数达1250亿,激活参数仅60亿,能实现显著性能提升。作者在DGX Spark平台上测试了Unsloth量化的该模型不同版本,目前仍在探索中。该内容可帮助了解Qwen系列新模型的特性与测试进展,值得关注。
- Sandboxing coding agents — Micah Lee 本文介绍为编码智能体设置隔离沙箱的具体方法,包括限制其仅访问单个GitHub仓库,以及使用专属的仅用于提交签名的SSH密钥。作者还提及自己参加DEF CON AI Village的HalCTF活动,回国后感染新冠生病的情况。该内容可帮助开发者提升智能体代码操作的安全性,具有实用参考价值。
- Why do OpenAI’s GPT-2 weights beat mine? Part four: digging into dropout — gilesthomas.com 作者在研究自己训练的模型时发现,其在指令微调测试中的表现不如OpenAI GPT-2小模型,正探究背后原因。作者注意到关于dropout的问题,原以为微调应沿用预训练的dropout设置,后思考到微调多epoch小数据集可能需dropout,还发现微调OpenAI模型时配置存在错误。该内容有助于理解模型微调的关键细节,值得相关研究者参考。
- Two Alleged ‘TeamPCP’ Hackers Arrested in Australia — BrianKrebs 澳大利亚联邦警方逮捕两名涉嫌TeamPCP的黑客,该犯罪集团是长期实施软件供应链攻击的组织,曾用Shai-Hulud蠕虫植入恶意代码。该组织通过窃取开发者凭证在开源工具中植入恶意代码,还举办竞赛激励成员开展更多供应链攻击。该内容披露了重大网络犯罪集团的运作细节,对了解供应链攻击风险有帮助。
- Elizabeth Warren’s Incoherent Outrage Regarding Apple’s Tariff Refund — John Gruber
- Panic Is Refunding Tariff Fees to Playdate Buyers — John Gruber 游戏公司Panic因关税成本问题,决定向Playdate买家退还此前收取的关税费用。该公司是小体量企业,曾在结账时明确标注关税项目,因吸收成本困难选择退款,认为这笔钱不属于自己。该内容体现了小公司应对关税成本的做法,有一定参考意义。
- Ads in Apple Maps Have Now Launched — John Gruber 苹果确认其地图应用已开始投放广告,广告分为搜索前的推荐地点广告和搜索结果中的相关广告。作者测试时看到HVAC承包商和洗车行的广告,首个非广告推荐是附近的咖啡店。该内容披露了苹果地图的新功能,对用户和广告主都有参考价值。
- ‘How Europe Is Killing Makers and Micro-Entrepreneurs’ — John Gruber 欧盟新包装规则将威胁创客和微型企业家,要求个体hobbyist每年花费数百欧元并提交文件,小公司受影响远大于大公司。作者以费城塑料袋禁令为例,说明简单有效的监管方式,认为欧盟规则过于复杂。该内容反映了监管政策对小微企业的影响,值得关注。
因果推断与营销科学
- Optimal Experimental Design for Network Experiments under Interference — Zuhra F. S. Lebbe, Asim K. Dey 本文针对网络实验中存在干扰时的最优实验设计问题展开研究,现有方法多局限于小型或简化网络,难以适配复杂真实场景。研究提出一种网络感知的处理分配框架,结合Fisher信息矩阵的最优准则,开发了可扩展至大型网络的高效局部搜索算法。通过模拟研究和大学住房、Facebook网络的应用,验证了拓扑感知实验设计的实际优势,为复杂网络下的实验设计提供了可行方案。
- Trading Scope for Credibility in Difference-in-Differences — Parush Arora, Abhishek Chand 本文聚焦双重差分法中平行趋势假设对部分处理队列失效的问题,此时平均处理效应(ATT)难以准确估计。研究提出用可信亚组局部ATT(LATT)替代原估计量,仅针对平行趋势可信的队列,点识别要求更弱,通过重加权组时间效应估计,搭配诚实敏感性界。模拟和页岩 boom 房价应用证明其优势,解决了部分队列平行趋势失效时的估计难题。
- Towards Robust Matched Observational Studies with General Treatment Types: Consistency, Efficiency, and Adaptivity — Siyu Heng, Elaine K. Chiu, Hyunseung Kang 本文针对匹配观察性研究中,现有稳健性指标仅适用于二元处理的问题展开研究,非二元处理时的指标缺失可能导致稳健测试建议误导。研究提出统一框架量化任意处理类型下的稳健性,包括处理二分法的负结果、两种敏感性参数化的对应关系,推广了设计敏感性和Bahadur-Rosenbaum效率,还提出数据自适应方法增强稳健性,填补了非二元处理匹配研究的指标空白。
- PLRD: Partially Linear Regression Discontinuity Inference — Aditya Ghosh, Guido Imbens, Stefan Wager 本文针对断点回归(RDD)中常用置信区间方法实际表现不佳的问题,提出部分线性回归断点(PLRD)估计量。在12个高知名度RDD应用校准的模拟中,其估计误差远低于现有方法,置信区间有效且更短,还提供大样本保证。模拟采用Wasserstein GAN生成合成数据评估方法,改进了RDD的置信区间构建,提升了估计准确性。
- Estimating Treatment Effects Under Bounded Heterogeneity — Soonwoo Kwon, Liyang Sun 本文针对恒定处理效应设定在异质性下有偏、完全灵活设定不精确的问题,提出在处理效应目标加权方差有界下的广义岭估计器regulaTE,生成异质性感知置信区间。岭惩罚最小化该置信区间长度,渐近有效即使重叠失败,可通过调整界做敏感性分析,应用于无混淆和交错 adoption 设计,解决了处理效应异质性下的估计难题。
- Endogenous Selection and Spillovers: Bayesian Inference for Policy-Relevant Causal Effects — Duong Trinh 本文针对内生选择和溢出效应并存场景下,传统因果推断方法不适用的问题,提出Spillover Roy模型,联合建模内生处理选择和潜在结果,通过低维邻居处理暴露映射捕捉溢出。定义政策相关的直接、溢出、总效应,开发贝叶斯数据增广算法估计,应用于美国机会区项目发现直接效应正、溢出有限,为政策评估提供了有效框架。
即刻简报
- 发布了: 测了一下 Ox-Alpha (GLM-5.3 Flash),太牛了! 远低于 V4 Flash 的价格,完爆 V4 Flash Vision 的能力,新的斩杀线来了。 整体能力我感觉和 V4 Pro 差… — 即刻·歸藏 本次测试了GLM-5.3 Flash(Ox-Alpha)模型,它的价格远低于DeepSeek V4 Flash,多模态能力远超V4 Flash Vision,整体能力接近甚至超过V4 Pro。在海报复刻、视频交互还原、视差滚动网页三个测试中,该模型均一次性完成或经少量调整后达标,表现出色。该模型价格极低,能提升AI渗透率,让更多人用上Agent,值得关注其对行业的影响。
- 发布了: 字节当年避开的坑,大模型公司正在往里跳 推荐引擎这个生意,字节跳动做了十几年。 抖音的“猜你喜欢”、今日头条的信息流、TikTok的For You页面背后都… — 即刻·莫唯书Mark 字节跳动早年推出过“灵驹”等推荐引擎对外售卖,但未成为营收主力,其核心是将推荐能力内化进产品变现。当下大模型公司将核心能力拆成Token售卖,本质是把智能工业化,却会陷入价格战,类似AI四小龙的困境。字节的模式更可持续,值得思考大模型的商业化路径。
- 发布了: 你知道吗,如果你想要那种“渐进式加载”的工程化写作,但又不想消耗宝贵的 ChatGPT Work(Codex)额度。 你可以在网页 ChatGPT 上连接 Notion 连接器后… — 即刻·评论尸 若不想消耗ChatGPT Work(Codex)额度,可在网页ChatGPT上连接Notion连接器,实现渐进式加载的工程化写作。该方式可调用Notion数据库、页面做RAG材料和模板加工,还能设置流程输出到指定位置。这是替代ChatGPT Work额度的实用方案,值得尝试。
- 发布了: Codepilot 0.67.10 更新了,本次更新内容: 优化了模型选择器(现在可以收藏对应的模型和渠道) 修改了右侧边栏的交互: 支持打开文件树、看板;同时内… — 即刻·歸藏 Codepilot 0.67.10版本更新了多项功能,包括优化模型选择器可收藏模型和渠道,右侧边栏支持文件树、看板,内置浏览器升级,Windows端支持自动更新,还新增支持GLM 5.3 Flash。这些更新提升了工具的实用性,值得关注其功能迭代。
- 发布了: 疯狂测试了一把,感觉国内模型里: 最前沿的还是 K3 最极致的是 DeepSeek 最懂股价的是 GLM 最经济的是 Qwen — 即刻·玉伯 作者测试了多款国内大模型,得出直观结论:K3最前沿,DeepSeek最极致,GLM最懂股价,Qwen最经济。这些结论基于作者的实际测试,能为其他用户选择模型提供参考,值得关注。
- 发布了: 终于,我的 1 人公司-博派, 用 2 年 2 个月时间,通过合作及性价比策略,完成了 200 家头部央国企的 AI 内训服务。包括移动、招行、华润…强度巨大,缺… — 即刻·进击的盖茨比 1人公司“博派”用2年2个月时间,通过合作及性价比策略,完成了200家头部央国企(如移动、招行、华润等)的AI内训服务。该服务强度大、缺乏复利,但作者为自己的成果感到骄傲。这是小团队做B端服务的案例,值得了解。
- 发布了: 我感觉动态 UI 生成是个错误的方向。 用户需要灵活多变且与功能完全适配的界面可能是个错误。 从大厂的产品运营经验来说,不论和功能有多适配,界面变动… — 即刻·评论尸 作者认为动态UI生成是错误方向,界面变动会增加用户操作的路径损耗,对平均数字素养不高的普通用户来说,熟悉的UI才是最重要的。该观点基于大厂产品运营经验,值得思考UI设计的核心需求。
- 发布了: workbuddy 在饱和式攻击下已经停止增长,怀疑留存非常差,无法支撑继续 而代码小浣熊一飞冲天??? — 即刻·橘AI 作者提到workbuddy在饱和式攻击下已停止增长,怀疑其留存非常差,无法支撑继续运营。而代码小浣熊则增长迅速,表现良好。这两款AI工具的市场表现差异明显,值得关注。
本期有 8 个源不可用:lcamtuf.substack.com、garymarcus.substack.com、rachelbythebay.com、joanwestenberg.com、dfarq.homeip.net、gwern.net、worksonmymachine.substack.com、tedunangst.com。