第 37 期
今日趋势
今天的简报涵盖AI技术探索、因果推断研究及行业动态三大板块,核心主线可提炼为两条:一是AI领域的多维度技术迭代与产品竞争,从大模型(如Deepseek多模态模型、Ox牛来)的性能比拼,到AI文本水印识别、安全界面设计、小众场景应用(ASCII图表)等细分方向的实证验证,再到Bun API等技术工具的更新,展现了AI技术在实用化与边界探索上的推进;二是因果推断与营销科学的方法创新,针对暴露映射、混合分布实验设计、协变量调整等实际场景难题,提出了多个针对性解决方案,为相关领域的研究与应用提供了关键参考。值得关注的共性是,AI产品与研究均聚焦“实用化”方向,大模型比拼性价比、因果推断方法解决实际场景痛点;而分歧则体现在对大模型的评价上,不同主体对Deepseek多模态模型与Ox牛来的表现各有侧重,反映出市场对AI产品的多元需求。
AI 技术博客
- Readers can’t identify watermarked AI text — seangoedecke.com 作者为验证AI文本水印是否能被读者识别,搭建在线测试网站,用Qwen模型生成带SynthID水印和无水印的回答,开展两轮测试。第一轮因选项设置问题得分异常,洗牌后73名参与者的平均得分接近随机猜测的3.33,说明读者无法有效识别带水印的AI文本,该测试为AI水印实际效果提供了实证参考。
- ChatGPT search now uses the site:operator at scale — simonwillison.net 该条目提及ChatGPT搜索功能已大规模启用site:运算符,但未提供具体内容或细节,仅为简短的功能更新预告。
- Pluralistic: The actual epistemic crisis (20 Aug 2026) — Cory Doctorow 本文探讨AI带来的实际认知危机,指出AI不仅是金融泡沫、环境灾难等,更通过深度伪造等技术让现实与虚假界限模糊,人们难以判断信息真伪。文中引用Surkov的策略说明信息操控危害,揭示AI对认知秩序的冲击,有助于理解AI时代的信息风险。
- A Sloppy Interface Is a Security Liability  — blog.jim-nielsen.com 本文提出界面设计质量可作为安全控制机制,粗糙的界面不仅影响品牌感知,还可能成为攻击者利用的载体。AI技术降低了仿冒界面的生成门槛,让攻击者更容易模仿品牌界面实施攻击,该观点为数字安全防护提供了新的思考角度。
- AI-generated ASCII diagrams — John 作者分享对AI生成ASCII图表的喜爱,认为其兼具反常规性与实用性,ASCII图体积小、可嵌入纯文本文件,避免与代码分离。作者测试Claude生成相关图表,部分效果较好,部分复杂图表可读性差,展现了AI在小众场景的应用潜力。
- A shot-scraper-style JSON API on Bun 1.4’s new Bun.WebView — simonwillison.net 该条目提及Bun 1.4版本新增了类似shot-scraper的JSON API,基于Bun.WebView,但未提供具体内容或细节,仅为简短的技术更新预告。
- Getting the Steam Deck LCD working on a Raspberry Pi — jeff@jeffgeerling.com (Jeff Geerling) 本文介绍Steam Deck原装的BOE TV070WXM-TV0 LCD屏,其参数优于树莓派官方7寸屏,此前无法在树莓派上使用。Scandent团队开发了该屏的Linux内核驱动,计划将其上游,解决了该屏在树莓派上的适配问题,为树莓派用户提供新方案。
- Reducing C++ template bloat by factoring out the type-dependent portions of the function — Raymond Chen 本文探讨C++模板的膨胀问题,指出模板每次实例化会生成新函数,带lambda时膨胀更严重,因每个lambda是唯一类型。作者提出将函数中公共部分封装为辅助对象的解决方案,减少重复实例化,缓解模板膨胀,为优化C++模板性能提供可行思路。
因果推断与营销科学
- Causal Inference under Interference with Learned Exposure Mappings — Cong Cao 本研究针对因果溢出分析中暴露映射常被假设已知的问题,聚焦环境场景下需从污染数据学习不可直接观测的传输过程诱导的暴露映射,探讨其不确定性对因果推断的影响。对比四种传输模型发现,虽污染预测精度相近,但溢出效应估计差异显著,仅预测一致不足以支撑可靠因果推断。该研究为学习暴露映射下的因果推断提供关键参考,避免仅依赖预测的误导。
- Variational Goal-Oriented Optimal Experimental Design for Mixed-Distribution Quantities of Interest: Application to Ship Roll Safety — Chen Cheng, Xun Huan, Yulin Pan 本研究面向混合离散-连续的目标量(QoI),针对船舶横摇安全评估中纯连续变分近似失效的问题,提出分离原子概率与连续分量的混合变分近似方案。该方法可恢复正确的期望信息增益(EIG)景观,提供稳定的EIG下界估计,识别有效波浪条件。它解决了混合分布QoI下面向目标的最优实验设计的技术难题,为船舶安全等领域实验设计提供新方案。
- Design-Aware Variance Reduction for Switchback Experiments: A Comparative Study — Sergei Pankratev 本研究针对在线平台常用的开关back等聚类随机设计,评估CUPED、CUPAC、DR等设计感知方差减少方法的有效性与效率,通过模拟分析不同参数下的表现并绘制适用场景图。研究明确了各方法的优势区间,以及时间聚类依赖、有限样本效应对方法改进的限制。它为在线平台聚类实验的方差减少提供实用指南,帮助从业者选择合适方法。
- Causal Generalization of Continuous Treatment Effects under Covariate Shift — Jay Jojo Cheng, Guanhua Chen 本研究针对协变量偏移场景下连续处理效应的因果泛化问题,现有方法假设源样本代表目标,提出两样本局部多项式框架及源到目标的距离协方差最优权重(DCOW)扩展。模拟显示该方法优于多种基线,PM2.5与心脏病死亡率的实证分析验证了其有效性。它解决了协变量偏移下连续处理效应泛化的难题,为环境健康等领域因果推断提供新工具。
- Shape-Preserving Covariate Adjustment via Empirical Likelihood in Randomized Experiment — Zhilan Lou, Jun Shao, Yuhan Qian, Tuo Wang, Yanyao Yi, Yu Du, Ting Ye 本研究针对随机实验中协变量调整不保持分布/生存函数单调性的问题,提出带协变量平衡约束的经验似然构造调整经验测度的方案。该方法自动保持形状约束,渐近正态且有明确效率增益,适用于多种随机设计,SURPASS-4试验验证了其理论优势。它为随机实验的分布估计提供统一、有效的方案,解决了协变量调整中的形状保留难题。
- Martingale R-learner: Estimating Time-varying Heterogeneous Treatment Effects for Time-to-event Outcomes — Jue Hou, Yuchen Qi, Ronghui Xu 本研究针对精准医学中时间结局的时变异质性处理效应(HTE)估计需求,扩展Neyman正交性框架,提出基于条件鞅残差分解的鞅R-learner。该方法减少了 nuisance模型的估计偏差,达到最优非参数估计率,酒精与痴呆的实证分析验证了其性能。它为时间结局的时变HTE估计提供新方法,助力精准医学的临床决策。
即刻简报
- 发布了: Deepseek 的多模态能力终于上了!是一个单独的模型,Deepseek V4 Flash Vision EXP。 他们说这个模型在多模态 Agent 上的能力已经逼近了 Opus 4.8。 纯文… — 即刻·歸藏 Deepseek发布了单独的多模态模型Deepseek V4 Flash Vision EXP,其多模态Agent能力逼近Opus 4.8,纯文本能力与Deepseek V4 Flash一致,价格相同,DeepSeek Harness已支持该模型,还推出免费文件API,上传过的图片用ID引用可免重传。该模型在多模态性能和成本间实现平衡,值得关注其对多模态模型市场的影响。
- 发布了: 今天在内测一个Agent 马上爱上了 1. 整个产品体验极其丝滑 2. 响应速度极快 3. 非常主动 4. 可以连接比如iOS的日历 即使在Agent满地爬的Today 依然能有… — 即刻·AI产品黄叔 作者内测一款Agent后十分喜爱,称其产品体验丝滑、响应速度快、服务主动,还能连接iOS日历。在当下Agent产品众多的环境中,这款内测Agent凭借出色的交互体验脱颖而出,核心优势在于流畅性与主动服务能力,值得参考其产品设计思路。
- 发布了: Ox 牛来可能是整个 8 月最惊喜的大模型了 deepseek v4-flash-vision-exp 根本不能打 强烈推荐试用 Ox 牛来 免费7天,以下平台,均已上线 Cola Openroute… — 即刻·AGENT橘 作者推荐Ox牛来大模型,称其是8月最惊喜的大模型,性能优于Deepseek V4 Flash Vision EXP,还提供7天免费试用,已在Cola、Openrouter等多个平台上线。该模型填补了部分同类型模型的不足,值得尝试其免费体验,了解新大模型的表现。
- 发布了: AI 行业在 DeepSeek 无良暴涨之后,陷入了一个尴尬的境地,Flash 模型成了鸡肋,能力不是那么强,没有多模态,又有点贵。 亟须一个又便宜又好又有多模态… — 即刻·AGENT橘 AI行业在DeepSeek相关变动后,Flash模型陷入能力不强、无多模态且价格高的鸡肋境地,急需高性价比多模态模型。Ox牛来上线,具备多模态、小参数、强后训练、Terra级别能力及Flash速度,目前在Cola限时免费体验。该模型填补了市场缺口,值得体验其表现。
- 发布了: 跟模型厂商合作了三次首发测试 第一次,价格很好,模型不行 第二次,模型很好,价格不行 第三次,模型很好,价格很好 期待不要作妖坐地涨价 😂 — 即刻·AGENT橘 作者分享三次与模型厂商的首发测试经历:第一次价格好但模型差,第二次模型好但价格高,第三次模型与价格均理想,希望后续不要坐地涨价。这反映了模型合作中常见的供需矛盾,第三次的理想状态值得期待,能为模型选型提供参考。
- 发布了: 艹,怎么一个偏僻的居酒屋也有人在聊seed在聊混元在聊DeepSeek — 即刻·瓦恁 作者感慨,哪怕是偏僻的居酒屋,都有人在讨论seed、混元、DeepSeek等AI模型,可见AI模型话题已渗透到日常生活的方方面面,不再局限于专业圈层。这种贴近生活的讨论场景,能直观体现AI的普及度,值得关注。
- 发布了: 资本市场也不再迷恋网络效应,回到了最聪明的人梦想登月、AGI和治愈癌症的时代,这是真正的人类的黄金时代。 — 即刻·老编辑 作者提出资本市场不再迷恋网络效应,转而关注AGI、登月、治愈癌症等前沿科技,认为这是人类的黄金时代。这反映了当前资本市场的风向转变,从追求流量转向追求前沿科技突破,值得了解行业资本的态度变化。
- 发布了: ai永远不会独立发明“okk” — 即刻·瓦恁 作者提出AI永远不会独立发明“okk”,点明了AI在特定创意或概念生成上的能力边界,即AI无法自主创造出这类特定的非逻辑推导的概念。这一观点能引发对AI能力局限的思考,值得关注AI的发展边界。
本期有 10 个源不可用:krebsonsecurity.com、lcamtuf.substack.com、garymarcus.substack.com、rachelbythebay.com、joanwestenberg.com、dfarq.homeip.net、gwern.net、worksonmymachine.substack.com、chiark.greenend.org.uk/~sgtatham、tedunangst.com。