第 16 期
今日趋势
今天简报的鲜明主线是AI模型的性能跃升与成本下降,尤其是DeepSeek V4 Flash正式版以远超Pro-Preview的姿态登场,其在多项Agent基准测试中大幅领先,且API价格低廉,直接引发多位开发者宣布免费开放热潮,凸显出“平民化Agent”的时代已至。与之呼应,GPT-5.6同样在降低推理成本40%的同时提升准确率15%,体现了头部闭源与开源模型在性价比之路上殊途同归。另一条值得关注的线索是技术细节的严谨性:GPT-2权重对比系列深入剖析了评估代码bug、过训练失效等实证问题,提醒开发者不要盲目复制他人结论。与此同时,扎克伯格宣称“AI未来为所有人”却需付费阅读的文章,与DeepSeek社区实际的免费开放形成了鲜明对比,揭示了愿景与落地之间的鸿沟。
AI 技术博客
- Advancing the price-performance frontier with GPT‑5.6 — simonwillison.net 本文介绍了GPT-5.6在性能与价格比上的重大突破,通过优化模型架构和训练策略,显著降低了推理成本同时提升了输出质量。关键数据显示,在标准基准测试中,GPT-5.6的准确率提升约15%,而API调用成本下降40%。这篇文章值得读,因为它为开发者提供了更经济高效的AI解决方案,直接影响模型部署与商业应用决策。
- Why do OpenAI’s GPT-2 weights beat mine? Part two: the bugfix — gilesthomas.com 作者深入分析为何其GPT-2风格模型在指令遵循评估上不如OpenAI原始权重,并发现评估代码中的一个bug。幸运的是,该bug不影响主要结论——OpenAI模型仍更优,但修正了基线数值,使后续实验更可靠。文章详细描述了bug根源(在训练循环中错误地使用提前停止后的模型进行测试)。值得读,因为它展示了AI辅助代码审查的价值,以及严谨实验设计的重要性。
- Why do OpenAI’s GPT-2 weights beat mine? Part three: testing overtraining — gilesthomas.com 作者测试了“过训练”是否能使其GPT-2风格模型匹配OpenAI的性能,但发现效果甚微。文章明确了过训练(超过Chinchilla最优token数)与过拟合的区别,并复现了实验。关键结论是:即使刻意增加训练数据量,也无法弥补与OpenAI模型的差距,暗示其他因素(如数据质量或架构细节)更为关键。值得读,因为它挑战了常见假设,为LLM训练优化提供了实证参考。
- llm 0.32rc2 — simonwillison.net llm 0.32rc2版本发布,主要修复了之前版本中的若干问题,并改进了对大型语言模型调用的稳定性。该版本优化了错误处理逻辑,提升了与多个后端API的兼容性。对于频繁使用LLM工具的开发者和研究者,此更新值得关注,因为它能减少使用中的异常中断,提高工作流效率。
- llm-chat-completions-server 0.1a0 — simonwillison.net llm-chat-completions-server 0.1a0首次发布,这是一个提供与OpenAI API兼容的聊天补全接口的轻量级服务器。它支持自定义模型加载和配置,便于本地部署和测试。该版本处于早期alpha阶段,但已实现基本功能。对于需要自托管LLM服务的开发者,这个项目提供了一种快速搭建方案的起点,值得尝试。
- llm 0.32rc1 — simonwillison.net llm 0.32rc1版本发布,引入了新的命令行工具功能,增强了模型输出格式的灵活性。该版本还改进了对系统提示词和上下文窗口的处理,并修复了部分已知的兼容性问题。对于依赖llm进行自动化脚本或实验的用户,此更新提升了稳定性和配置自由度,建议升级以获取更好的使用体验。
- The AI Phrasebook — Andrew Nesbitt 该文用Unix/POSIX概念类比AI术语,如将Agentic比作bash,Function calling比作RPC,MCP比作CGI等,形成一套幽默的“AI短语手册”。每个类比都精准抓住了技术本质,例如将Hallucination比作“以200状态码返回的404页面”。值得读,因为它以极简方式打通了经典系统与AI前沿的认知桥梁,让技术理解更生动。
- Mark Zuckerberg: ‘The AI Future Is for Everyone’ — John Gruber 马克·扎克伯格在《华尔街日报》发表评论文章,宣称AI超级智能将在未来几年赋予每个人超越人类能力的创造与发现能力。他畅想AI将帮助人们建立新业务、改善生活与健康,并暗示可能用于构建元宇宙。讽刺的是,这篇“面向所有人”的文章需要付费订阅才能阅读。值得读,因为它反映了科技领袖对AI未来的乐观愿景,但也暴露了其言论与实际受众间的矛盾。
因果推断与营销科学
- Power-Optimal Covariate Adjustment for Switchback Experiments — Sergei Pankratev 该文针对交换实验中聚类大小不等导致估计量方差膨胀的问题,提出一种基于预测作为协变量(CUPAC)的最优方差缩减方法。核心是平衡随机单元内和单元间的噪声预测,以最大化统计功效,并通过蒙特卡洛模拟验证了理论框架。最后讨论了实际应用中的效率增益与局限。对于从事在线实验设计的研究者,该方法提供了提升交换实验效力的实用工具。
- Towards Best Practices for Covariate Adjustment in Regulatory Trials: From Fixed to Data-Adaptive Approaches — Laura B. Balzer, Lei Nie, Issa J. Dahabreh, Kajsa Kvist, Tianyue Zhou, Demissie Alemayehu, Larry Han, Zhiwei Zhang, Salina P. Waddy, Andrew Mertens, Christian B. Pipper, Ken Wiley, Jr., Margot Yann, Gilmer Valdes, Xu Shi, Mark van der Laan, Maya Petersen, Kelly Van Lancker 该文探讨了监管随机试验中协变量调整的最佳实践,从固定回归模型扩展到数据自适应方法。强调基于预指定、透明、可复现且稳健的调整策略,可保证精度提升并保持统计有效性。作者希望促进对原则性数据自适应协变量调整的接受。对于临床试验统计师和监管机构,本文提供了实施灵活调整的实用建议。
- Doubly Robust Estimators of Quantile Treatment Effects With Semiparametric Cumulative Probability Models — Hao Wu, Chun Li, Bryan E. Shepherd 该文针对偏态分布结果变量,提出基于累积概率模型(CPM)的分位数处理效应(QTE)双重稳健估计框架。发展了逆累积分布函数和直接估计两种策略,均具有双重稳健性和渐近正态性,并扩展到概率处理效应。模拟研究显示,经验sandwich估计和bootstrap在模型误设下仍提供稳健方差估计。对于处理偏态结局的因果推断研究,该方法提供了更可靠的分布效应估计。
- Evaluating Algorithm-Assisted Human Decision-Making Over Repeated Algorithm Exposure: Recommendations for Effect Estimands and Experimental Design — Maggie Wang, Michael Baiocchi 该文关注算法辅助人类决策中,人类行为随重复暴露而适应的现象,定义了考虑适应性的效应估计量,并提出了最小化最大步进双楔形设计。通过比较常见设计,发现它们在高估偏倚、警报疲劳等行为适应下产生有偏估计。对于人机协同决策系统的评估,本文提供了更贴合实际的设计框架。
- A Novel Approach to Instrumental Variable Estimation: TEAM-IV — Steven Y. Alberding, Patrick J. Breheny 该文提出TEAM-IV方法,通过识别联合有效的工具变量集合来应对排除限制违反问题,即使在只有少数工具有效时也能通过聚合’团队’得到可靠估计。模拟表明,在无效工具普遍时,TEAM-IV的绝对估计误差低于sisVIVE和CIIV。在MESA数据的孟德尔随机化应用中展示了其实用性。对于工具变量分析中无效工具较多的场景,该方法提供了稳健的替代方案。
- DoTime: A Synthetic Benchmark Generator for Interventional and Counterfactual Time Series — Dennis Thumm, Billy Tim Anthony, Ying Chen 该文推出DoTime,一个开源可扩展的时间序列因果结构模型生成器,支持连续时间干预窗口、反事实采样和非平稳动态。附带四个冻结评估套件,包含10万条轨迹和八种识别结构,并验证了干预训练相对于同等容量观测模型的方向准确率优势。对于因果时间序列方法开发,该基准提供了标准化评估平台。
即刻简报
- 发布了: Deepseek V4 Flash 更新到正式版了,Agent 能力大幅提升,超过了 V4 Pro 的 Preview 版本! 官方测评成绩: Terminal Bench 2.1: 82.7 NL2Repo: 54.2 Cy… — 即刻·歸藏 DeepSeek V4 Flash 正式版发布,Agent 能力大幅提升,全面超越 V4 Pro Preview 版本。官方测评成绩显示:Terminal Bench 2.1 达 82.7,NL2Repo 54.2,Cybergym 76.7,DeepSWE 54.4,Toolathlon 70.3,Agent Last Exam 25.2,Automation Bench 25.1,DSBench-FullStack 68.7,DSBench-Hard 59.6。模型结构保持与 Preview 一致,仅重新后训练,已上线 API 并支持 Codex 格式。该版本以显著性能提升和低成本优势,值得开发者关注和试用。
- 发布了: 发现了 Codex 一个非常牛逼的更新,好像没见他们宣传! Codex 现在有专门给图像 Agent 做的 UI 模式了: 生成图片后,点击图片会单独弹出一个侧边栏预览… — 即刻·歸藏 Codex 推出专为图像 Agent 设计的 UI 模式,用户生成图片后可点击预览,在侧边栏进行评论、擦除和调整大小。左上角切换按钮可让聊天流仅显示图像,便于专注调整,并支持多选图片批量修改。这种交互方式比主流的无限画布更易理解,可能大幅取代设计 Agent 的工作。该更新展示了 AI 图像处理的新范式,值得关注。
- 发布了: 感谢梁文锋,等 DeepSeek V4 Flash 的 API 服务稳定可用后,打算在 YouMind 里免费开放给所有用户 让 Fable 5、K3 等都见鬼去,贵得离谱的东西,没意思 … — 即刻·玉伯 作者感谢梁文锋,计划在 DeepSeek V4 Flash API 稳定后,于 YouMind 中免费开放给所有用户,并批评 Fable 5、K3 等价格昂贵。核心观点是让平民也能用上高端 AI 服务,体现出普惠精神。YouMind 已接入最新版 Flash,可抢先体验,值得关注其免费开放进程。
- 发布了: Seedance 2.5 模型已经给超创开放了内测。 1. 最高支持 30 秒:一次可以生成 30 秒长度的视频 2. 目前最高支持 720P 3. 全能参考:最多一次可以上传 50 … — 即刻·歸藏 Seedance 2.5 模型开放内测,支持一次生成最长 30 秒视频,最高分辨率 720P,并允许上传最多 50 个素材作为参考。该版本大幅提升了视频生成的长度和素材容量,为创作者提供更多灵活性。内测阶段的这一突破值得视频生成领域用户关注。
- 发布了: DeepSeek V4 Flash 模型智能水平竟然超过 GLM 5.2 ,接近 GPT 5.6 Luna (Max) 现已上架 Cola 的 Token Plan 和积分模型。 梁圣威武,我们终于可以做免… — 即刻·AGENT橘 DeepSeek V4 Flash 模型在智能水平上超越 GLM 5.2,接近 GPT 5.6 Luna(Max),已上架 Cola 的 Token Plan 和积分模型。作者宣布因此可推出免费计划,邀请用户免费体验。该模型以超强性能结合免费策略,为开发者提供了极具吸引力的选择。
- 转发了: 一条动态 — 即刻·瓦恁 Kuli Kuli 手写菜单识别翻译服务经过两年多打磨,效果达到业界最佳。对比谷歌翻译、Papago 和苹果翻译,其在复杂手写日语菜单上表现最优,而 ChatGPT 5.6 Sol 需约 4 分钟。该服务已上线,值得有手写识别需求的用户尝试。
- 发布了: 在流沙上盖房子?错! 只要你的产品由 deepseek 驱动,今天,一行代码没改,您猜怎么着? 产品里的 Agent 突然成爹了! 这纯是 90 年在浦东新区盖房子。 — 即刻·赵纯想 作者指出,只要产品由 DeepSeek 驱动,一行代码不改,产品中的 Agent 能力会突然大幅提升,如同在 90 年代的浦东新区盖房子,占据先发优势。核心观点是 DeepSeek 的升级直接赋能现有产品 Agent,带来巨大红利。该动态以幽默方式强调技术红利,值得投资 AI 应用的人思考。
- 发布了: 万众期待,DeepSeek V4 Flash 正式版终于降临 Flash 正式版直接大幅远超 Pro-Preview 新的模型基线 让人人都能用得起 Agent — 即刻·AGENT橘 DeepSeek V4 Flash 正式版发布,性能大幅超越 Pro-Preview 版本,成为新的模型基线。其核心意义在于让人人都能用得起 Agent,降低 AI 使用门槛。该版本以平民化价格和强大能力,值得所有 AI 应用开发者关注和部署。
本期有 10 个源不可用:lcamtuf.substack.com、garymarcus.substack.com、rachelbythebay.com、joanwestenberg.com、dfarq.homeip.net、gwern.net、refactoringenglish.com、worksonmymachine.substack.com、mjg59.dreamwidth.org、tedunangst.com。