Codex 中的一项新技巧允许用户提示 Sol 代理自动配置 Luna Max 子代理,通过任务委托将额度消耗减半并使编码产出翻倍。 该方法通过将昂贵的 Sol 用于规划和审核,而将更便宜的 Luna Max 用于有明确边界的任务,显著降低了使用 Codex 的成本,在不增加订阅费用的情况下使生产力翻倍。 该技巧需要在 ~/.codex/agents/luna-worker.toml 创建自定义代理配置文件,设置模型为 gpt-5.6-luna 和 reasoning_effort = max,或者直接指示 Sol 为批量任务生成独立的 Luna Max 线程。
微软于 2026 年 7 月 24 日发布了一封题为《开放权重与美国 AI 领导力》的公开信,由包括英伟达、亚马逊和 OpenAI 在内的 235 家公司签署,主张不应因安全担忧而禁止开放权重模型。随后,Anthropic 发布了自身立场反对蒸馏,而超过 1300 名前沿 AI 公司员工签署了《掌控前沿》公开信,呼吁国际社会共同治理自动化 AI 开发。 这些公开信标志着 AI 政策的一个重要时刻,主要行业参与者公开辩论开放权重模型的安全与创新权衡。其结果可能影响美国政府对 AI 开发的监管,并塑造开放与封闭 AI 生态系统之间的未来平衡。 值得注意的是,Anthropic 未签署微软的公开信,而是单独发布了回应,强调威权政府滥用模型的风险,并呼吁打击工业规模的蒸馏行为。由 OpenAI 首席科学家和 Anthropic CEO 等知名 AI 研究人员签署的《掌控前沿》公开信,表达了对竞争压力通过自动化研究加速 AI 进展的担忧。
rss · Simon Willison · 8月2日 04:16
核验: 多源印证
背景: 开放权重模型发布训练好的神经网络权重供下载和微调,但与开源 AI 不同,它们通常不包含训练数据或完整的开发代码。蒸馏是一种模型从另一个模型的输出中学习的技术,一些公司如 Anthropic 将其视为安全风险。随着先进 AI 模型能力增强和滥用担忧加剧,关于开放权重的辩论日益激烈。
分析师 Eric Xu(@xleaps)在 X 上发帖详细解释了多模态输入(尤其是视觉)对于 AI 在人类中心世界中运行不可或缺的原因,并对比了 DeepSeek 和 Anthropic 在 AGI 开发中共同避免多模态输出的策略。 这一澄清厘清了被滥用的‘多模态’概念,并揭示了 AGI 开发中的一个根本性战略分歧:多模态输入对于 AI 在现实世界中落地至关重要,而 DeepSeek 和 Anthropic 等领先实验室则将多模态输出视为可分离的工程问题,而非 AGI 的核心能力。 作者认为,多模态输入(尤其是视觉信号)有助于 AI 在人类中心的世界模型(即围绕人类感官构建的世界)中实现接地。DeepSeek 和 Anthropic 避免多模态输出,因为它涉及扩散/流匹配、分布坍缩和多步一致性等工程挑战,这些可以从通用智能中外化。DeepSeek 的非 API、非开放权重版本已经可以处理视觉信号,一些企业用户正在尝试给 DeepSeek 嫁接 Vision Transformer(ViT)。
twitter · Eric Xu (e/Mettā) · 8月2日 13:58
核验: 多源印证
背景: 人择原理源自宇宙学,认为宇宙的参数是为有意识生命精细调节的;在 AI 中,它意味着世界是围绕人类感官构建的,因此 AI 必须接受这些模态才能有效交互。AI 中的接地(grounding)是指将模型输出锚定到可验证的外部来源,以确保准确性并减少幻觉。Vision Transformer(ViT)是一种专为计算机视觉设计的 Transformer 架构,它将图像分割成小块并通过自注意力机制处理,使语言模型具备视觉理解能力。
Andrej Karpathy 加入 Anthropic 后首次发布长帖,提出一项新测试:给 Claude Opus 5 约 100 万 Token 的预算,要求它生成三个 3D 渲染版本来讲述《指环王》的故事。模型成功生成了 3D 渲染,但 Karpathy 指出一个关键问题:AI 在生成过程中无法连续感知自己的工作,只能分段截图。 这项测试超越了简单的图像生成基准(如“骑自行车的鹈鹕”),用复杂的长期创作任务挑战 AI。它暴露了当前 AI 系统在自我监控和长时间生成过程中保持连贯性的根本局限,这对电影制作、游戏开发和长内容创作等应用至关重要。 Karpathy 使用了 Claude Opus 5,该模型拥有高达 100 万 Token 的上下文窗口。模型生成了 3D 渲染,但过程显示 AI 无法连续感知自己的输出,只能间隔截图,丢失了帧之间的连续状态。
twitter · 歸藏(guizang.ai) · 8月2日 03:57
核验: 多源印证
背景: 大型语言模型中的上下文窗口定义了模型一次能处理的最大 Token 数量。Claude Opus 5 是 Anthropic 于 2026 年 7 月发布的强大代理编码模型,拥有大上下文窗口。传统的 AI 基准测试通常涉及根据文本提示生成简单图像,而 Karpathy 的测试通过要求在大 Token 预算下生成连贯的 3D 叙事,推动了边界,突显了在长时间生成任务中保持自我意识和连续性的挑战。
I think Opus 4.6 was the Opus model with the best personality and writing style.
Something's off with Opus 5 - it tends to give me overly long replies, use Claude-speak way too much (e.g., "here's the honest truth"), and is too judgemental.
Opus used to be a joy to talk to like a trusted friend. Not so much anymore.
Follow Builders · X 动态 · Peter Yang · 8月2日 03:22 UTC · 喜欢 751 · 转发 19 · 回复 165
I'm feeling spicy tonight so let me just say it:
I think Opus 4.6 was the Opus model with the best personality and writing style.
Something's off with Opus 5 - it tends to give me overly long replies, use Claude-speak way too much (e.g., "here's the honest truth"), and is too judgemental.
Opus used to be a joy to talk to like a trusted friend. Not so much anymore.
Follow Builders · X 动态 · Swyx · 8月2日 03:15 UTC · 喜欢 53 · 转发 3 · 回复 12
Swyx reflects on rarely attending his own conference, recommends a talk on 'fighting slop with slop,' and discusses the value of slop-tolerant AI-native programming languages.
中文摘要Swyx 反思自己很少能参加自己举办的会议,推荐了一场关于“以次充好对抗次品”的演讲,并讨论了容忍次品的 AI 原生编程语言的价值。
Follow Builders · X 动态 · Andrej Karpathy · 8月2日 03:00 UTC · 喜欢 9895 · 转发 674 · 回复 595
We're starting to leave the territory where you'd test an LLM by e.g. "create an svg of pelican on a bicycle". As one idea to generalize it, I was interested what Opus 5 would do if I gave it the first paragraph of the Lord of the Rings, a 1M token budget (~$10) and asked for three js render of it. Opus went off for ~2 hours and wrote 5500 lines of code that (procedurally) rendered the story. It's kind of janky but fun. But it's a bit mindboggling that the LLM has to place and orchestrate various polygon assets in (x,y,z) coordinates and write code that animates it all, and that it even does anything at all.
I also like this kind of examples because no one in their right mind would ever spend the time to write something this custom but LLMs have all the stamina and patience in the world, so it's an example where we go from "no one would ever do this" to "sure, why not, it's ~free". There might be a lot more. But I'm excited about creating hyper custom worlds that you can imagine dropping players into, e.g. here to participate in the LoTR story as a spectator NPC, or one of the characters, or etc. Something like an ephemeral GTA of X on demand.