第 36 期
今日趋势
今天的内容主要围绕两大主线展开,一是AI领域的技术优化、应用探索与风险反思,二是因果推断方法学的创新突破。AI技术层面,既有提升模型训练效率的实用技巧(如PyTorch内置GELU吞吐量较手写版本提升20%),也有针对AI代理安全、未知代码运行的技术方案,还涉及AI在生物医药领域的突破性应用(个性化癌症mRNA疫苗三期数据积极),同时对比了不同AI模型的性能差异,也不乏对AI领域乱象的批判。因果推断方向则聚焦于解决大规模观察性研究、政策效应分析中的实际痛点,提出了多个高效、低偏差的框架与方法,为社科与营销科学的实证研究提供了新工具。此外,内容还涵盖航天技术突破、金融资本开放、养老规划案例等跨领域动态,整体呈现出技术创新与行业应用、民生服务交织的特点。
AI 技术博客
- Use the built-in GELU, don’t roll your own! — gilesthomas.com 本文对比了PyTorch内置GELU与Sebastian Raschka书中手写GELU的训练效率,相同GPT-2小模型训练中,手写GELU每秒处理21000 token,内置GELU达25000 token,提升20%吞吐量。这一发现能帮助LLM开发者优化训练速度,降低时间成本,因此值得关注。
- Asymmetric Agents — @edent 本文探讨AI代理的不对称性风险,指出未来个人使用的低复杂度代理,可能被亚马逊等巨头的高性能代理操纵、欺骗,即使是简单约会订位等任务也存在被恶意代理干扰的可能。这一分析揭示了AI代理普及背后的潜在安全隐患,值得关注。
- Our Servants Will Do That For Us — borretti.me 本文批判“自动化后进入全意义工作未来”的观点,指出自动化技术会同时替代枯燥工作和有意义工作,且人类更倾向便利而非维护人际关系。这一论点挑战了对AI未来的乐观预期,值得深入思考。
- smolmachines / smolvm as a sandbox for untrusted Python & JavaScript — simonwillison.net 本文介绍smolmachines/smolvm作为沙箱,用于安全运行不受信任的Python和JavaScript代码,为开发者提供轻量的未知代码执行方案,相关内容值得关注。
- Quoting Jeremy Morrell — simonwillison.net 本文引用Jeremy Morrell的观点,具体围绕AI或技术相关话题展开,相关讨论值得参考。
- Conceptual integrity and counting lines of code — simonwillison.net 本文探讨软件开发中概念完整性与代码行数的关系,分析两者在项目设计与实现中的作用,相关内容值得开发者关注。
- On wrapping a callable in a lambda that just calls it with the same parameters — Raymond Chen 本文指出C++中无需将lambda包裹在另一个lambda中调用,因为lambda本质是带函数调用运算符的类,直接传递即可,包裹会增加不必要的间接开销,这一优化技巧值得C++开发者学习。
- Issues in the Repo — Andrew Nesbitt 本文讨论GitHub宕机时issue数据丢失的问题,介绍多个将issue数据存储在仓库内的工具项目,分析不同存储方案的优缺点,为开发者提供解决问题的思路,值得参考。
因果推断与营销科学
- Centroid-Referenced Mahalanobis Matching (CRM): A Scalable, Representation-Based Framework for Causal Inference in Large Observational Studies — Keming Hu, Yingpei He 本研究提出Centroid-Referenced Mahalanobis Matching(CRM)因果推断匹配框架,解决大规模观察性研究中匹配计算成本高、重叠不足的问题。该框架复杂度低,在Criteo数据集上保留至少99.4%的处理单元,36种配置中31种的MaxSMD低于校正倾向得分匹配,速度快约一个数量级。它为大规模因果匹配提供了高效且支持诊断的方案,值得关注。
- Non-parametric assessment of the calibration of individualized treatment effects — Mohsen Sadatsafavi, Jeroen Hoogland, Thomas P. A. Debray, John Petkau 本研究针对个体化治疗效应(ITE)模型的适度校准评估难题,提出非参数方法,解决反事实未观测和连续预测值正则化的挑战。该方法基于累积预测误差的随机过程,结合布朗运动渐近推断,模拟验证了其检测校准偏差的能力,配套有cumulcalib R包。它无需正则化或函数形式假设即可评估ITE校准,为模型性能评估提供了新工具。
- Causal Mediation Analysis for an Interrupted Time Series: Stabilized Mediator Weighting with an Application to a Vehicle Emissions Policy — Shalini Jayanetti, Sumeet Kalia 本研究针对中断时间序列设计的因果中介分析,提出稳定中介权重估计方法,用于分解政策干预的总效应为直接和间接效应。模拟显示该方法将间接效应偏差从0.19降至0.03,覆盖率从0.003提升至0.83;应用于安大略排放政策,得到臭氧直接减少2.113ppb等结果。它拓展了中断时间序列的中介分析,解决了中介-结果混杂的偏差问题。
- Measurement Error-Robust Causal Inference via Constructed Instrumental Variables — Caleb H. Miles, Linda Valeri, Brent Coull 本研究提出无需外部测量误差信息的测量误差鲁棒因果推断方法,针对协变量或中介变量测量误差的场景,利用构造的工具变量实现线性回归下的一致估计。该方法应用于孟加拉国母婴重金属暴露研究,估计铅对出生长度的直接和中介效应。它解决了测量误差下因果估计的痛点,无需额外数据或误差分布知识,实用性强。
- A Design-Based Approach to Testing and Inference in (Quasi-)Experiments with Spillovers — Yechan Park 本研究针对准实验中政策溢出效应的暴露测度选择问题,提出设计驱动的测试与推断框架,利用正交条件选择测度的函数形式和参数。该框架在空间网络依赖下具有一致性和渐近正态性,应用于扶贫项目修正了半径估计,得到不同政策效应。它为溢出效应研究提供了数据驱动的测度选择方法,提升政策评估的准确性。
- Difference-in-Differences Models in the Presence of Time-Varying Mediators — Kyunghoon Ban, Zhengrun Chen, D'esir'e K'edagni 本研究探讨含时变中介的双重差分(DiD)模型,指出传统双向固定效应(TWFE)回归无法正确估计处理组平均直接效应,提出条件DiD估计方法,结合稳定中介效应假设恢复间接效应。应用于铁路与农地价值研究,得到传统TWFE未发现的正向直接效应。它拓展了DiD模型到时变中介场景,解决了传统方法的偏差问题。
即刻简报
- 发布了: ai 总算是离开 coding 和 work 这种无聊的领域了 AI + 医药,人类之光 quote from indigo 个性化癌症mRNA-4157 在三期临床试验中取得积极结果,股价暴涨… — 即刻·AGENT橘 本条内容围绕AI与医药结合展开,Moderna的个性化癌症mRNA疫苗(mRNA-4157)三期临床试验取得积极结果,股价暴涨100%。该疫苗通过AI分析肿瘤抗原定制,先在黑色素瘤验证,技术逻辑可行但成本较高。AI在生物医药领域的应用突破潜力大,对医药行业和相关投资有重要参考意义。
- 发布了: 不行,dsh和codex还是有差距,同样的任务交过去,dsh完成的差强人意,只能打个60分,codex完成的非常令人满意,能给90分 — 即刻·泓深 本条对比了DSH和Codex两个AI模型的任务完成度,相同任务下DSH仅得60分,Codex得90分,两者差距明显。Codex在任务执行上的表现远优于DSH,性能差距较大。该内容直观体现了不同AI模型的实际应用差异,对模型选型有参考价值。
- 转发了: 一条动态 — 即刻·瓦恁 本条是转发的招聘信息,蚂蚁/网商银行有一个岗位空缺,位于杭州或上海,负责支付宝内农业领域的Agent开发,求推荐或自荐,提供了邮箱和扫码申请渠道。该岗位属于互联网大厂的农业AI方向,适合相关求职者关注,有明确的申请路径。
- 发布了: 前几个月看到有个AI神棍,说宇宙是世界模型。 给我笑麻了,我本来想回他,狗才是世界模型。 想想算了,毕竟人家真的骗了这么多年,装了这么多年先知人设… — 即刻·老编辑 本条吐槽了“宇宙是世界模型”的AI神棍言论,认为其荒谬,本来想反驳后放弃,还提到当前骗钱难,装神棍改企业家加剧内卷。该内容反映了AI领域的乱象,有现实讽刺意义,值得关注AI行业生态的读者了解。
- 发布了: 1997年 — 即刻·老编辑 本条内容仅发布了“1997年”这一表述,无更多详细信息,核心是对该年份的简单提及。虽篇幅简短,但可能是关联特定事件或感慨的引子,适合关注相关年份背景的读者参考。
- 一觉醒来世界发生了什么 重大突破!我国首次实现火箭陆地回收|界面新闻 · 快讯 — 即刻·即刻资讯台 本条是界面新闻的快讯,内容为我国首次实现火箭陆地回收,属于航天领域的重大技术突破。这一突破体现了我国航天技术的进步,对航天产业发展有重要意义,值得关注航天领域动态的读者了解。
- 发布了: 40万亿北水南下,Welcome to Hong Kong~ 国家金融监管总局明确表态:支持内地保险资金通过“沪深港通”投资香港ETF。 港交所、特首、财爷、证监会轮番表… — 即刻·王紫君Zima 本条内容提及近40万亿内地保险资金将通过“沪深港通”投资香港ETF,国家金融监管总局明确支持,香港作为资本出海中转站,2024年险资在港投资收益率约15%。关键结论是险资借道香港合规配置全球资产,是国家资本开放的重要举措。该内容涉及金融市场重大动向,对投资和政策解读有较高参考价值。
- 发布了: 昨天是个浪漫的日子,帮团队同事接待了一对很特别的夫妻。 家里在内地已经配置了十几份保单,现在主要考虑的一个是退休现金流补充,一个是海外资产配置… — 即刻·王紫君Zima 本条内容是帮同事接待的一对夫妻的养老规划案例,该夫妻已有十几份保单,需求是退休现金流和海外资产配置,选择了法国安盛的储蓄计划,有稳定收益和品牌保障。该案例提供了具体的养老规划方案,对保险配置和养老安排有参考意义,值得关注。
本期有 9 个源不可用:lcamtuf.substack.com、garymarcus.substack.com、rachelbythebay.com、joanwestenberg.com、dfarq.homeip.net、gwern.net、worksonmymachine.substack.com、chiark.greenend.org.uk/~sgtatham、tedunangst.com。