第 10 期
今日趋势
今天简报围绕两条主线展开:一是AI模型的本地化部署与隐私保护,从Nativ在Mac上运行本地模型,到欧盟强制Google向第三方AI服务开放Android设备功能并共享搜索数据,再到LG禁止电视被用作代理节点,均凸显出用户与监管层对数据主权和隐私安全的日益重视;二是AI在专业领域的深度渗透与突破,小红书dots-note-3.0模型在IMO数学竞赛中获满分、Claude Code团队分享编码工具经验、以及多篇因果推断与法务会计的学术方法,共同展示了AI正从通用能力向结构化复杂场景和严谨科学推理演进。值得关注的共性是,无论商业巨头还是创业团队,都在加速将AI嵌入垂直领域并解决实际痛点;而分歧则体现在数据共享的开放程度与监管干预力度上——欧盟要求Google以FRAND价格提供搜索数据,而LG则直接禁止代理功能,反映出不同主体对数据流动与隐私保护的权衡差异。
AI 技术博客
- Nativ: Run AI models locally on your Mac — simonwillison.net 本文介绍Nativ工具,让用户在Mac上本地运行AI模型,无需联网。关键结论是Nativ支持多种主流模型,保护隐私且运行高效。值得读:适合关注本地AI部署和隐私保护的Mac用户。
- ★ European Commission: ‘Guidance to Google for AI Interoperability on Android & Sharing of Google Search’ — John Gruber 欧盟委员会根据数字市场法案对Google发布两项约束性措施,要求Google允许第三方AI服务平等访问Android设备功能,并向搜索引擎和AI聊天机器人共享搜索数据。关键结论:Google需以FRAND价格提供用户搜索数据,并创建API使第三方AI助手获得与Gemini同等能力。值得读:了解欧盟如何监管科技巨头,影响AI和搜索竞争格局。
- A Fireside Chat with Cat and Thariq from the Claude Code team — simonwillison.net 本文是Claude Code团队Cat和Thariq的炉边对话,分享AI编码工具的开发经验。关键观点:团队在构建Claude Code过程中面临挑战并总结出实用见解。值得读:对AI辅助编程感兴趣的开发者可从中获得启发。
- Forensic accounting in Python — John 本文介绍用Python进行法务会计的逆向数据分析方法,通过枚举所有可能组合并与已知总和比对来推断变量取值。关键结论:当所有组合总和唯一时,可精确反推;若不符则假设有误。值得读:展示编程在审计和调查中的实用技巧。
- Making an agile version of a Windows Runtime delegate in C++/WinRT, part 2 — Raymond Chen 本文继续讨论在C++/WinRT中创建Windows Runtime委托的敏捷版本,通过检测IAgileObject接口避免不必要的包装。关键结论:若委托已标记为敏捷则直接返回,否则创建敏捷包装器;注意函数参数不能进行复制省略。值得读:帮助C++/WinRT开发者优化委托的线程安全性。
- LG to Ban Residential Proxies from Smart TV Apps — BrianKrebs LG电子宣布将禁止智能电视应用将电视用作住宅代理节点,此前研究显示超过42%的LG webOS应用包含代理SDK。关键结论:LG要求开发者移除代理选项,否则应用将被暂停,并加强审核流程。值得读:关注智能设备隐私风险及厂商应对措施。
- Pluralistic: Trump’s America can’t even win a rigged game (22 Jul 2026) — Cory Doctorow 文章讨论特朗普治下美国如何破坏自己主导的国际秩序,导致世界加速去美国化。关键结论:美国曾从规则中获益,但其他国家因成本更低而容忍;特朗普的破坏使世界迅速填补美国留下的空白。值得读:分析美国霸权衰落及其全球影响。
- Scattered thoughts on social geolocation — @edent 作者希望社交平台支持分享位置,但ActivityPub和AT Protocol缺乏此功能。关键结论:地理微语法提案存在用户需求不明确的问题,需要了解用户期望(如查看附近帖子、签到等)。值得读:对社交网络地理位置功能设计有参考价值。
因果推断与营销科学
- SPYCE: A Doubly Robust Estimator for Trials Targeting Early Huntington Disease under Outcome-Dependent Censoring — Kihyun Han, Yanyuan Ma, Karen Marder, Tanya P. Garcia 针对亨廷顿病早期临床试验中结局依赖删失导致估计矛盾的问题,提出双重稳健估计器SPYCE。SPYCE在任一模型正确设定时均一致,且方差最小,可非参数估计。应用PREDICT-HD数据后,识别尾状核和壳核体积比为最敏感终点,每组仅需241人即可检测疗效,而其他方法需数十万人。该方法为神经退行性疾病试验设计提供高效工具,大幅降低样本量需求。
- Adaptive Penalization and Bootstrap-Smoothed Inference for Two-Sample Mendelian Randomization with Summary Data — Muhammad Qasim, Kai Wang, Ishan S Bhatt 针对两样本孟德尔随机化中水平多效性导致因果推断偏差的问题,提出两种自适应惩罚方法MR-ALasso和MR-ALasso-B。MR-ALasso通过自适应权重改进无效工具变量识别一致性,MR-ALasso-B结合bootstrap平滑提升后选择推断的覆盖率和I型错误控制。模拟显示MR-ALasso优于MR-Lasso,真实数据分析验证了实用性。该方法提供更可靠的因果推断工具,并附有R包便于应用。
- A Bayesian Approach to Causal Cure Models — Emma Torrini, Ma"ilis Amico, Nicolas Molinari, Cl'ement Berenfeld 针对时间-事件数据中存在治愈个体的情形,提出贝叶斯主分层因果估计方法。引入新的因果估计量(非始终治愈层的生存效应),并与经典混合治愈模型保持直接联系。模拟显示方法稳健且优于现有方法,应用于腹部手术后呼吸衰竭随机试验。该方法为临床试验中治愈率评估提供灵活统一的因果推断框架。
- Blinded sample size recalculation in randomized controlled trials with analysis of covariance — Takumi Kanata, Yasuhiro Hagiwara, Koji Oba 针对协方差分析中样本量设计需预知协变量与结局关联的难题,提出盲态样本量重估方法。该方法基于渐近相对效率,仅需最小分布假设,可适应任意模型误设。模拟显示达到名义功效且不膨胀I型错误,在HIV临床试验中样本量减少三分之一。该方法实用性强,适用于非正态分布数据。
- Treatment effect estimation by comparing observed and predicted outcomes: conditions for valid inference and practical illustration — Lotta M. Meijerink, Artuur M. Leeuwenberg, Jungyeon Choi, Bas B. L. Penning de Vries, Johannes A. Langendijk, Judith G. M. van Loon, Remi A. Nout, Karel G. M. Moons, Ewoud Schuit 阐明使用治疗前预测模型估计新治疗效果的识别条件。在潜在结果框架下给出有效平均处理效应估计所需条件,并通过放疗案例说明。该方法为模型评估提供理论依据,确保比较观察与预测结果时的因果推断有效性。
- Doubly Robust Weighted Regression for Causal Inference under Confounder Missingness — Md. Shaddam Hossain Bagmar, Hua Shen 针对观察性研究中混淆变量缺失导致因果估计敏感的问题,提出双重稳健缺失指示变量加权最小二乘估计器(MI-WOLS)。在治疗或结局模型之一正确设定时一致,模拟显示偏差小、方差估计准确、覆盖概率接近名义水平。该方法提供灵活的双重稳健替代方案,优于现有单稳健方法。
即刻简报
- 发布了: CodePilot 重大更新,现在可以免费蹬 Grok 4.5 了! 得益于老马非常仁慈的算力供给,现在支持通过 Super Grok(也就是 Twitter 账号)的授权,直接在 Co… — 即刻·歸藏 CodePilot 发布重大更新,支持通过 Twitter 账号授权免费使用 Grok 4.5,同时新增千问 3.8 Max Preview 模型。关键结论:用户只需在设置中添加 XAI Grok OAuth 即可免费登录,Twitter Premium 用户额度更高。值得读:如果你是开发者或 AI 工具用户,这是免费获取 Grok 4.5 的实用指南。
- 发布了: laper 方法: 1、离大厂三条街。 2、找一个结构化非常复杂的领域。 譬如剧本,有极为复杂的结构化要求,CodeX能写剧本,但无法输出统一好莱坞格式剧本,… — 即刻·赵纯想 提出“泥潭论”AI 应用创业方法:远离大厂竞争,选择结构化复杂的领域(如剧本、工程标书),为深陷数据泥潭的用户构建 Agent,并强调多人协作场景(利用 CRDT 技术壁垒)。关键结论:AI 创业处于冰点,但正是最佳时机,需屏蔽噪音、找到第一个付费用户。值得读:为创业者提供了差异化策略和实操路径。
- 发布了: AI 把你原来看不见的问题全部放大 经验变成一种需要工程化管理的资产 大脑已经承担不了 AI 带来的吞吐量,所以需要构建承接 AI 吞吐量的基础设施,AI 如… — 即刻·余一.Dev 指出 AI 将原本看不见的问题放大,经验需要工程化资产管理,大脑无法承载 AI 吞吐量,需构建认知基础设施。关键结论:人从最小工作单元演变为智能系统节点,认知结构需像微型组织一样具备分工、反馈、记忆和治理能力。值得读:启发个人如何设计认知系统以应对 AI 时代的信息洪流。
- 发布了: 谷歌昨天晚上上线了 Gemini 3.6 Flash模型,感觉 Gemini 3.5 Pro模型没了呀。 这次的 3.6 Flash 比原来的 3.5 Flash 在各个评分上都上涨了一点,不过涨… — 即刻·歸藏 谷歌上线 Gemini 3.6 Flash 模型,性能小幅提升,同时推出更快的 3.5 Flash-Light,并宣布开始训练 Gemini 4(号称有史以来最大规模)。关键结论:Gemini 3.5 Pro 可能被取代,但迭代速度落后于同行,Gemini 4 预计年底推出。值得读:了解谷歌模型动态及行业竞争格局。
- 发布了: 没想到小红书模型训的也可以啊,我一直以为他们只做一些 Agent 方面的事情。 刚才看到他们在 2026 年的国际奥林匹克数学竞赛(IMO)上,那个 dots-note-… — 即刻·歸藏 小红书 dots-note-3.0 模型在 2026 年国际数学奥林匹克竞赛中以 42 分满分获得金牌,成为首个在 IMO 官方评卷中获满分的模型,近期将开源。关键结论:模型在证明题上使用新颖解法,展现强大数学推理能力。值得读:见证中国模型在数学推理上的突破,以及大模型在数学发现中的重要性。
- 发布了: 个体第一次需要像设计公司、设计操作系统一样,去设计自己的认知基础设施。以前,人就是最小工作单元。以后,人只是整个智能系统中的一个节点。 — 即刻·余一.Dev 强调个体需像设计公司一样设计自己的认知基础设施,人不再是最小工作单元,而是智能系统中的一个节点。值得读:简洁有力地概括了 AI 时代个人角色的根本转变,引发对自我认知管理的思考。
- 转发了: 认可 — 即刻·余一.Dev 转发观点:不使用 Claude Code 订阅可避免封号、IP 限制等问题,效率显著提升。值得读:为开发者提供另一种工具使用思路,减少订阅依赖。
- 发布了: 最近关于如何做一个好的研究,跟ai一起聊了好多好多,受益匪浅 — 即刻·余一.Dev 作者与 AI 深入讨论如何做好研究,收获颇丰。值得读:暗示 AI 在研究辅助上的价值,激发读者探索 AI 协作研究的可能性。
本期有 9 个源不可用:lcamtuf.substack.com、garymarcus.substack.com、rachelbythebay.com、joanwestenberg.com、dfarq.homeip.net、gwern.net、worksonmymachine.substack.com、chiark.greenend.org.uk/~sgtatham、tedunangst.com。