第 9 期
今日趋势
今天的简报呈现两条主线:一是AI在数学与代码生成领域取得突破性进展,例如Claude Fable 5发现雅可比猜想反例、Grok 4.5成功解谜题,以及Codex的“更多详情”功能被高度评价,显示出大模型正从辅助工具向独立解决专业难题演进;二是围绕AI模型生态的版权、监管与使用壁垒持续引发争议,既有关于美国开源模型因服务条款限制而落后于中国模型的悖论性讨论,也有用户因账号购买流程繁琐、硬件识别风险而受阻的现实案例。值得关注的共性在于,AI工具正快速渗透至数学研究、软件开发、家庭网络管理乃至企业软件设计等多元场景,但分歧同样显著:对蒸馏的道德假设和版权政策立场相左,企业软件入口强调“责任”而非“注意力”的洞察,以及内容创作者通过法律声明明确禁止AI训练数据使用,均反映出技术进步与制度约束之间的张力。
AI 技术博客
- ‘Who’s Afraid of Chinese Models?’ — John Gruber 本文讨论了美国开源模型对中国模型的依赖问题。关键结论是:由于美国开源模型必须遵守前沿实验室的服务条款,导致其性能不如中国替代品,且只能蒸馏二次蒸馏的模型。作者认为蒸馏本身并非坏事,因为大语言模型本身就是对互联网知识的蒸馏。美国应通过立法明确训练数据为合理使用,并禁止禁止蒸馏的服务条款,以促进创新并减少对中国的依赖。值得一读是因为它提出了一个悖论性的解决方案,并挑战了关于蒸馏的道德假设。
- Who’s Afraid of Chinese Models? — simonwillison.net 本文标题与第0条相同,但正文为空。核心观点应参考第0条:美国开源模型因服务条款限制而落后于中国模型,蒸馏并非本质问题,美国应调整版权政策以促进创新。由于原文极短,提炼为:文章探讨中国模型通过蒸馏快速追赶美国前沿,并提出美国应立法允许蒸馏以保持竞争力。
- Locally everywhere does not imply everywhere — John 本文报道了数学家Levent Alpöge使用Claude Fable 5发现了雅可比猜想的一个反例。关键结论是:该反例是一个从ℝ³到ℝ³的多项式函数,其雅可比行列式恒为-2,但函数整体不可逆,从而否定了猜想。文章还指出,Claude本身并不知道自己参与了这一发现,它只是工具。值得一读是因为它展示了AI在数学研究中的辅助作用,以及一个长期未决猜想的突破。
- Solving a chess puzzle with Grok 4.5 — John 本文测试了Grok 4.5生成Prolog和Lean代码解决国际象棋谜题的能力。谜题是在5×5棋盘上放置5个白皇后和3个黑皇后,使不同颜色皇后互不攻击。Grok生成的Prolog代码一次运行成功,得到8个解;Lean代码经过三次迭代后正确运行。文章展示了Grok在代码生成方面的进步,并给出了一个代表性解。值得一读是因为它对比了不同AI的代码生成能力,并提供了一个有趣的组合优化问题。
- Weekly Update 513: Clauding The Home Network — Troy Hunt 本文介绍了作者如何使用Claude整合UniFi、Home Assistant和Pi-Hole的信息,将家庭网络中的噪声转化为有用信号。关键案例是当所有Sonos设备无法连接音乐服务时,Claude迅速指出Pi-Hole已宕机,通过重启PoE端口解决问题。文章强调AI在家庭网络管理中的实际价值。值得一读是因为它展示了AI如何帮助普通人快速诊断复杂系统问题。
- [Sponsor] WorkOS MCP: Manage Your Auth Platform From Any AI Agent — Daring Fireball Department of Commerce 本文是WorkOS MCP的赞助广告,介绍其允许AI代理通过MCP服务器管理认证平台。关键功能包括:调试SSO、管理用户、调整策略、配置品牌等数百种操作,可通过OAuth连接并使用作用域令牌。用户可截图让代理匹配登录页面。值得一读是因为它展示了AI代理如何自动化原本需要人工操作的认证管理任务。
- Reverse-engineering is cheap now — simonwillison.net 本文标题为“逆向工程现在很便宜”,但正文为空。核心观点应围绕AI降低逆向工程成本展开。提炼为:随着AI工具的发展,逆向工程变得更容易、更廉价,这改变了安全研究和软件分析的格局。值得一读是因为它提示了技术进步对传统领域的冲击。
- –end-of-options — Andrew Nesbitt
本文介绍了Git中一个鲜为人知的标志
--end-of-options,用于在修订版本解析中明确终止选项。由于Git已将--用于分隔修订版本和路径,导致无法用--终止选项,因此引入了此标志。关键结论是:--和--end-of-options在Git中功能不同,不能互换。文章还指出该标志在不同子命令中的支持时间不同。值得一读是因为它澄清了一个常见的误解,并提供了安全处理不受信任修订版本的实践。
因果推断与营销科学
(本期摘要服务不可用,仅提供标题与链接。)
- Are Your ML Experiments a Mess? Here’s the Fix — Alex Davis
- Benchmarking Goodness-of-Fit and Calibration Algorithms for Logistic Regression Classifiers: A Large-Scale Simulation Study under Sparse Data — Ebrahim Khaled Ebrahim, Ahmed El-Kotory
- Which Effect of Race? Causal Inference without Holding All Else Equal — Thomas Leavitt
- Neural Networks of Outcome Weighted Learning for Individualized Treatment Rules — Zhu Wang
- Claim-Specific Admissibility of PCA Biplot Interpretations: Target Alignment, Spectral Identifiability, and Projection Adequacy — L. R. M. Pinto, C. T. S. Dias
- On the Expectation of the Local-to-Zero Cross-Validated Log Likelihood Criterion for Bandwidth Selection in Kernel Spectral Estimation — Meng-Chen Hsieh, Clifford Hurvich
即刻简报
- 发布了: 昨天 Twitter 上讨论最热的一条内容,超过了两千万次浏览。 Anthropic 的一个数学家用 Fable 5 随手证明了一个雅可比猜想的反例。 这个猜想 87 年来一直… — 即刻·歸藏 Anthropic 一位数学家通过 Fable 5 模型在 Twitter 上发布了一串公式,证明了雅可比猜想的一个反例,该猜想 87 年来未被解决,曾入选 21 世纪 18 大数学难题。该推文获得超过两千万次浏览,随后 OpenAI 内部 Codex 版本也独立证明了类似反例,表明高级 GPT 模型已能独立解决此类难题。值得注意的是,张益唐博士曾因试图证明该猜想而长期失业,这一对比引发了对学术圈“有毒导师”现象的讨论。本文值得一读,因为它不仅展示了 AI 在数学领域的突破性能力,还触及了学术伦理与传播学的有趣案例。
- 发布了: 纯想全栈,彻底完结撒花! 视频是 web全栈系列 课后彩蛋之《与往事干杯》。 本次压轴的 web 全栈,有13个高清视频,从 0 到 1 万整实战了 laper 同款的 … — 即刻·赵纯想 该内容宣布“纯想全栈”系列课程正式完结,并附有课后彩蛋视频《与往事干杯》。压轴的 web 全栈部分包含 13 个高清视频,从零到一实战了基于 Mastra 框架的 Agent 应用开发以及 AI 敏捷全栈开发与部署。整个网站最终定稿为 132 个高清 4K 视频,涵盖 web 全栈、iOS、安卓、Python 后端、产品理念及 GEB 系统讲解等。文章提供了完结特别优惠码 AKALOL,并邀请跟学用户留言感受。值得一读,因为它为想系统学习全栈开发和 AI 应用的人提供了完整的课程资源和优惠信息。
- 发布了: codex的更多详情的功能,是最近对我最有帮助,用起来最爽的功能 — 即刻·余一.Dev 作者认为 Codex 的“更多详情”功能是近期对自己最有帮助、用起来最爽的功能。该功能可能提供了更深入的代码解释或上下文信息,显著提升了开发效率。虽然原文极短,但核心观点明确:Codex 的详情功能值得优先使用。值得一读,因为它直接点出了 Codex 中一个容易被忽视但实用性极强的特性。
- 发布了: 企业里的入口和消费互联网完全不是一回事。 消费互联网的入口是「注意力」。 企业软件的入口是「责任」。 员工打开企业软件,不是为了聊天,而是因为: … — 即刻·余一.Dev 文章指出企业软件的入口与消费互联网截然不同:消费互联网的入口是“注意力”,而企业软件的入口是“责任”。员工打开企业软件并非为了聊天,而是为了查看今天必须处理的事务、避免出问题的事项以及需要承担责任的任务。因此,企业真正的入口不是即时通讯(IM),而是“责任队列”(Responsibility Queue)。值得一读,因为它为企业软件设计提供了深刻的洞察,有助于理解用户真实动机。
- 发布了: 发现个Obsidian很好的用法 我用Codex配置完后,每天点击一下日历按钮,就会打开今日任务(如果没有就新建) 然后输入今日三件事 晚上直接打开Claudian(… — 即刻·AI产品黄叔 作者分享了一个 Obsidian 的高效用法:通过 Codex 配置后,每天点击日历按钮即可打开或新建今日任务,输入今日三件事;晚上再通过配置了 Codex 接入的 Claudian 侧边栏口述复盘,内容自动更新并保存到日记中。这一流程极大简化了日记记录,对“P 人”(随性型人格)非常友好。值得一读,因为它提供了一个可复用的自动化日记方案,能提升个人效率。
- 发布了: 《奥德赛》片尾字幕的倒数第二段话: All rights in this work are reserved for purposes of laws in all jurisdictions pertaining to data mining or… — 即刻·kyth 《奥德赛》片尾字幕倒数第二段声明:本作品保留所有权利,适用于所有司法管辖区关于数据挖掘或 AI 训练的法律,包括但不限于欧盟指令 2019/790 第 4(3) 条。明确禁止使用本作品训练 AI。该声明反映了版权方对 AI 训练使用数据的警惕态度。值得一读,因为它展示了当前内容创作者如何通过法律声明保护作品免受 AI 训练侵扰,具有行业参考意义。
- 发布了: AI 已经认识东方明珠了,但它认识上海吗? IP SHANGHAI 发起 AI²SH 活动,面向全球创作者的长期计划~! 首期主题是「Visit SH: digital landmarks」,… — 即刻·海辛Hyacinth IP SHANGHAI 发起面向全球创作者的长期计划 AI²SH,首期主题为“Visit SH: digital landmarks”,邀请大家重新想象上海的城市地标,作品形式不限。作者和阿文作为特邀嘉宾参与。优秀作品将进入 IP SHANGHAI 与澎湃新闻的跨平台传播计划,有机会成为城市国际传播的官方创意素材并参与线下展示。值得一读,因为它为创作者提供了展示作品并参与城市传播的宝贵机会。
- 发布了: 最近旅游回来,打算买个Claude账号继续玩 然后供应商说有点风险,但给面子先走一波检测 一通操作下来花了我1小时 干了啥呢?简单说说: 我大致罗列一下 … — 即刻·AI产品黄叔 作者旅游归来后尝试购买 Claude 账号,供应商进行了长达一小时的检测流程,包括检查本机是否被封过、浏览器缓存清理情况、完全删除旧客户端、进行三种魔法检测(确保无国内 IP 泄露且三个暴露 IP 一致)、安装指定魔法软件并重新检测,最后还需重新注册账号并养号三天。即便如此,仍可能因 Mac 硬件号被识别为中国而失败。值得一读,因为它揭示了当前获取 AI 账号的复杂性和风险,反映了监管与使用之间的现实矛盾。
本期有 10 个源不可用:lcamtuf.substack.com、garymarcus.substack.com、rachelbythebay.com、joanwestenberg.com、dfarq.homeip.net、gwern.net、worksonmymachine.substack.com、chiark.greenend.org.uk/~sgtatham、anildash.com、tedunangst.com。