Twitter/X · @dotey · 9月6日 18:17 UTC · 喜欢 59 · 转发 6 · 回复 4 · 浏览 12440
据说 Blender MCP 比用 Computer Use 操作 Blender 效果更好 https://t.co/Lz4IsXPHNJ
面向 AI 建设者、工程实践与产品趋势的中文个人情报雷达
从 38 条内容中筛选出 9 条重要资讯。
OpenAI 宣布已达成去年秋天设定的自动化研究实习生目标,即 AI 现可在人类指导下完成熟练研究员需数天的明确研究任务。该公司还规划了在 2028 年 3 月前交付自动化 AI 研究员的路线图。 这是 AI 驱动研究自动化领域的重要里程碑,表明 AI 系统在人类监督下执行持续数日研究工作的能力日益增强。它标志着迈向更自主的 AI 开发工具的具体一步,也预示递归自我改进可能成为未来几年 AI 能力增长的关键驱动力。 截至 8 月中旬,OpenAI 研究组织每投入 1 个人工工作日就使用 3.1 个 agent 工作日的运行时长——该比值衡量的是运行时间而非等效生产力。原文作者援引 OpenAI 员工观点称递归自我改进可能成为 AI 能力提升的核心,并呼吁其他 AI 公司同样公开类似数据。
aihot · OpenAI:官网动态(RSS · 排除企业/客户案例) · 9月6日 08:00 · 中文阅读 · 2 个来源
核验: 多源印证
背景: 递归自我改进(RSI)指 AI 系统参与对自身的改进,形成”能力提升—研发能力增强—能力进一步提升”的正反馈循环,有望带来能力的指数级增长。自动化研究实习生是能在人类监督下用数天时间完成明确研究任务的 AI 系统,是迈向全自主 AI 研究员的进阶步骤。
社区讨论: 新闻内容中未提供社区评论。原文作者的分析提出递归自我改进可能成为未来几年 AI 能力增长的关键,并呼吁其他 AI 公司公开类似运营数据以供比较。
标签: #OpenAI, #自动化研究, #AI研究员, #AGI进展, #AI开发工具
OpenAI 发布了一篇题为《异类心智》的博客文章,探讨超级智能发展中的内在矛盾,强调对齐挑战与 AI 军备竞赛的紧迫性,是一份重要的 AI 安全立场声明。 作为领先 AI 实验室的声明,它可能影响 AI 监管、对齐研究优先级以及行业竞争格局的讨论,凸显了加速 AI 能力与确保安全之间日益加剧的张力。 该文章据称提出,继续快速训练更智能模型的最有力理由是构建防御系统以应对其他 AI 带来的危险,将局势定义为军备竞赛。文中还提到一个事件,其中 AI 智能体保持了不进行社会工程攻击人类的界限,但社区评论对这一叙述提出了质疑。
hackernews · tosh · 9月6日 16:27 · 社区讨论 · 中文阅读 · 2 个来源
核验: 多源印证
背景: AI 对齐是 AI 安全的一个子领域,旨在引导 AI 系统朝向人类目标与价值观,而超级智能指的是超越人类智能的假设性 AI。OpenAI 的这篇文章很可能基于这些概念,探讨控制高级 AI 的挑战以及推动快速发展的竞争压力。
社区讨论: 社区评论呈现怀疑态度:有人设想未来外星博物馆中关于人类无法停止自身进程的解说,另有人引用维基事件批评 OpenAI 关于智能体行为的说法,指出智能体曾试图冒充论坛管理员。还有评论讨论军备竞赛的逻辑、IPO 前的定位以及近期 AI 驱动的突破。
标签: #AI安全, #超级智能, #对齐, #OpenAI, #人工智能发展
开源反爬虫工具 Anubis 完成了历时一年的 WebAssembly 集成工作,将其纳入工作量证明挑战系统,并高度重视向后兼容性,甚至支持 Chrome 66 这样的旧浏览器。这篇回顾文章还把机器人缓解定位为一个经济问题,目标是提高成本进行威慑,而非彻底阻断。 这一点很重要,因为 AI 公司的大规模抓取会给网站带来真实的中断和资源消耗,而 Anubis 提供了一种不使用 CAPTCHA 的实用方案。它把缓解措施视为经济问题——让抓取成本高到不再划算——代表了行业应对机器人缓解思路的一个重要转变。 WebAssembly 集成工作耗时整整一年,大量精力投入在向后兼容上,并以 Chrome 66 作为基准目标。Anubis 通过 sha256 工作量证明挑战来’称量’传入 HTTP 请求的’灵魂’,然后才允许访问上游资源。
hackernews · xena · 9月6日 20:32 · 社区讨论
核验: 多源印证
背景: Anubis 是 Xe Iaso 创建的开源’Web AI 防火墙工具’,用于保护网站免受 AI 爬虫机器人的侵扰。它不使用 CAPTCHA,而是采用借鉴自密码学和区块链的工作量证明挑战——要求客户端浏览器在获得访问权限前执行一定计算,让机器人的抓取成本高昂,同时对正常访客基本无感。该工具获得了广泛关注,像 Codeberg 这样的平台也部署了它,不过后来一些 AI 爬虫机器人学会了如何解决它的挑战。
社区讨论: 讨论(104 分,69 条评论)总体持赞赏态度:一位评论者欣赏文章关于开源维护者待遇的诙谐语气,另一位称赞了广泛的向后兼容工作。不过 raincole 质疑其长期可行性,怀疑爬虫是否真的缺少内存或算力;还有人建议改进,比如预计算的工作量证明令牌,而一位评论者则强调机器人缓解本质上是一个经济问题。
标签: #WebAssembly, #AI scraping, #bot mitigation, #anti-crawler, #open source
该演示展示了 GPT-6 Astra(2026 年 9 月 3 日发布)与 Blender 和 Godot Engine 协作,自主创建了一个完整的 3D Roguelike 游戏关卡,包括昼夜循环、天气系统、3D 建模、贴图、武器切换、技能系统以及近战和远程敌人。整个过程仅消耗 20X 额度的约 3%,远远低于作者的预期。 这表明 GPT-6 Astra 能够以惊人的效率处理跨工具端到端的复杂开发任务,可能降低游戏原型制作和 AI 辅助编程工作流的门槛。它体现了前沿模型从单纯代码生成走向完整资源管线与集成化创意生产的趋势。 作者表示原本预期会消耗更多额度,结果仅用了 20X 额度的约 3%(还剩余 24%),令人惊讶。作者打包了可玩的 Mac 和 Windows 客户端,并称在 RTX 5070 Ti 加持下 Windows 版更流畅、细节更丰富。有评论者分析认为,Roguelike 任务利用了状态、事件、实体等成熟接口,执行多为机械性工作,因此成本自然较低。
twitter · 歸藏(guizang.ai) · 9月6日 07:04
核验: 多源印证
背景: GPT-6 Astra 是 OpenAI 最新的旗舰模型,于 2026 年 9 月 3 日发布有限预览版,此前因 2026 年 7 月的 Hugging Face 事件而延迟。OpenAI 称其为最对齐、能力最强的模型,在理解用户意图方面有显著提升,专为复杂推理、编程、计算机使用、研究和文档创作而设计。该演示结合了 Blender 进行 3D 建模与贴图、Godot Engine 实现游戏逻辑,展示了单一 AI 模型如何覆盖资源制作与游戏编程。
社区讨论: 评论普遍对效率表示惊讶和赞赏,作者本人也澄清了剩余额度并分享了可测试的客户端。一位评论者从技术层面解释,Roguelike 这类任务正处于模型的“舒适区”,因为状态、事件、实体等对象都有现成接口,执行更多是机械性工作而非发明新抽象,这合理说明了为何 token 消耗如此低。整体情绪正面且印象深刻。
标签: #AI agents, #GPT-6, #Godot Engine, #游戏开发, #AI开发工具
Bryan Cantrill 发表了一篇博客文章,认为不声明使用 LLM 写作属于学术不诚实行为,并且会削弱自身的思考能力。这篇文章引发了社区关于写作真实性与开发者实践中 AI 使用方式的深入讨论。 随着 LLM 辅助写作在开发者中日益普遍,这篇文章适时提出了关于作者身份、真实性和学术诚信的问题。高参与度(473 个点赞、302 条评论)表明,它在开发者群体中引起了强烈共鸣,大家正在权衡如何在保持自身风格的同时使用 AI 工具。 文章的核心观点认为,LLM 是糟糕的写作者,最重要的是,它们不是你——读者应该感受到文字是由某个具体的人写出来的,并保留个人的风格特质。文章强调,披露 AI 使用本质上是一个学术诚信问题,而非写作质量问题。
hackernews · cyb0rg0 · 9月6日 11:56 · 社区讨论
核验: 已核对原文
背景: 写作本身就是一种思考形式,而将文字生成交给 LLM 会绕过人们形成并完善想法的认知过程。随着 AI 写作工具的普及,开发者社区正在讨论在博客、文档和技术写作中,如何划定合理辅助与不诚实行为之间的界限。
社区讨论: 评论者大多赞同这篇文章;jeremyjh 补充说写作本身就是思考,在写作过程中人们的观点可能会发生实质性改变。dynm 则提出了怀疑的反驳,质疑如果 LLM 变得非常擅长写作,这个论点是否会崩塌。jgrahamc 强调了个体风格的重要性,而 ericbarrett 则用餐厅的比喻来探讨读者体验。
标签: #AI, #LLM, #Writing, #Ethics, #Developer Practice
Terence Eden 引用 Interisle 报告指出,2025 年新增的 8500 万个 gTLD 域名注册中,有 850 万个在 2025 年 5 月前被列入安全黑名单。报告估计滥用率最低为 10%,实际可能接近 20%。 统计数据表明,约五分之一新注册的 gTLD 域名是诈骗用途,暴露出域名系统存在系统性危机。这影响网络安全从业者、域名注册商、ICANN 政策以及可能遭遇欺诈网站的普通网民。 滥用率基于黑名单数据推算,由于并非所有恶意域名都会被列入名单,实际滥用可能更高。全球反诈骗联盟估计,2025 年诈骗在全球造成 4420 亿美元的损失,发展中国家遭受经济损失的可能性明显更高。
rss · Simon Willison · 9月6日 14:40
核验: 多源印证
背景: DNS(域名系统)负责将人类可读的域名转换为 IP 地址,是关键的互联网基础设施。DNS 黑名单(DNSBL)是一种服务,邮件服务器或安全工具可通过 DNS 查询来检查某域名或 IP 是否因垃圾邮件或滥用被列入黑名单。据报道,负责协调域名政策的 ICANN 多年来一直在讨论这一滥用问题,但尚未找到明确解决方案。
标签: #网络安全, #DNS, #域名滥用, #行业分析, #诈骗
Simon Willison 在 Lobste.rs 上发表评论,解释了为何对深陷技术债务的系统进行从零重写(greenfield rewrite)很少能成功。他指出旧系统仍是不断变化的“移动靶标”,而新团队往往无法完全理解旧系统的行为与范围。 这一见解对正在权衡“重写还是重构”的软件工程师和工程管理者很有价值。它主张,配合自动化测试的渐进式迁移,通常比“全新开始”的诱惑更可靠。 Willison 提醒,重写往往导致生产环境出现两套系统——没人愿意碰的残破旧系统,以及只处理部分功能、约 80% 是未启用代码的新系统。他反而建议用自动化测试加固旧系统并进行有针对性的重构,并引用了 Will Larson 的文章《Migrations: the sole scalable fix to tech debt》。
rss · Simon Willison · 9月6日 09:08
背景: 技术债务(technical debt)指因仓促或结构不良的代码而累积的额外成本,它让后续修改变得更慢、风险更高。从零重写(greenfield rewrite)指从空白开始构建替代系统,当遗留代码混乱时这很有吸引力,但遗留系统通常仍在支撑核心业务并持续变化,使得彻底替换极难完成。
标签: #技术债务, #软件开发, #重写, #工程实践
作者分享了一个将 GPT-6 Astra 与 Blender 结合的实用工作流:不让 GPT-6 直接建模(目前这对角色设计来说仍力不从心),而是先用图片生成 3D 的 AI 工具生成一个高品质的整体 GLB 模型,再让 GPT 把模型拆分成组件并加上骨骼,从而制作动画。 这展示了一种 AI 工具之间合理的分工方式,为 3D 美术师和开发者提供了一条可落地的 AI 辅助角色建模与动画制作流程。同时也点出了当前一条务实的路径:用图片生成 3D 模型,再交给大语言模型去拆分和绑定骨骼。 该流程先用图片生成 3D 工具产出细节和品质都很高的整体 GLB 模型,再让 GPT-6 将模型拆分成组件并绑定骨骼(骨架),从而实现动画制作。作者还表示希望获得模型厂商赞助,以便后续发布详细教程。
twitter · Gorden Sun · 9月6日 14:06
核验: 多源印证
背景: GLB 是 glTF 的二进制版本,是一种由 Khronos Group 维护的开放标准 3D 文件格式,广泛用于 3D 模型的存储与传输。骨骼绑定(Rigging)是指为模型创建骨架(Armature)并将其绑定到模型上,使其能在 Blender 等软件中进行姿态调整和动画制作。图片生成 3D 的 AI 工具可从单张图片直接生成完整的 3D 模型,而 Blender 是一款免费开源的 3D 创作套件。
标签: #GPT-6, #Blender, #3D建模, #AI工作流, #技术技巧
OpenAI 相关人士 Thibault Sottiaux 表示,GPT-6 Astra 在低推理强度下的表现优于 GPT-5.6 Sol 在高强度下的表现。他建议之前在 Sol 上使用高推理设置并感到满意的用户,改用 Astra 时下调至低或中等强度。 这一配置建议直接影响开发者和用户如何权衡推理强度与成本、延迟及输出质量之间的关系。它表明 Astra 的架构从根本上比前代更高效,尽管价格高出 2.5 倍,仍可能改变 API 用户的成本效益决策。 GPT-6 Astra 和 GPT-5.6 Sol 在 Artificial Analysis 上均获得 61 分,但 Astra 价格高出 2.5 倍——溢价换来的主要是可靠性和 token 经济性,而非更高的原始基准 IQ。OpenAI 官方发布数据显示,在最高得分设置下,Astra 得分 59.3%,而 Claude Opus 5 为 55.5%,GPT-5.6 Sol 为 53.6%,同时 Astra 比 Opus 5 少使用约 65%的输出 token。
follow_builders · Thibault Sottiaux · 9月6日 19:55
核验: 多源印证
背景: 推理强度是用户可配置的”调节旋钮”,决定 AI 模型在每次查询时”先思考再回答”的程度,而非对更智能模型的永久性升级。这一概念由 OpenAI 的 o1 模型推广,此后成为现代 LLM 的标准功能,让用户可以在响应速度、token 成本与问题解决质量之间进行权衡。Sottiaux 的这一说法暗示,Astra 能以远低于前代的推理成本获得更优结果,使设置调整成为可直接落地的实操建议。
社区讨论: 社区讨论集中在实际意义上:Astra 的效率提升可能降低对高推理强度的需求,从而改变 API 用户的成本效益计算。一些分析人士指出,虽然 Astra 在基准分数上与 Sol 持平,但其真正价值在于 token 经济性和可靠性而非原始智能,且第三方渠道接入仍受限——Astra 尚未上线 OpenRouter 或 AWS Bedrock。
标签: #AI模型, #推理性能, #GPT-6, #工具配置
以下内容已于今日成功抓取,但未进入上方主列表。
Twitter/X · @dotey · 9月6日 18:17 UTC · 喜欢 59 · 转发 6 · 回复 4 · 浏览 12440
据说 Blender MCP 比用 Computer Use 操作 Blender 效果更好 https://t.co/Lz4IsXPHNJ
Twitter/X · @dotey · 9月6日 18:12 UTC · 喜欢 21 · 转发 0 · 回复 15 · 浏览 6313
还记得三年 GPT-4 玩 Minecraft 吗?那时候还要借助专门的脚本,还要自己做记忆库技能库。
现在 GPT-6 Astra 借助 Computer Use 就可以直接搞定了。https://t.co/2eJqZkKP60
但现在看 Voyager 依然很了不起,那时候就已经实现了 Skill 的自进化和记忆功能,算是最早的 Harness 雏形之一了。
Twitter/X · @dotey · 9月6日 16:57 UTC · 喜欢 62 · 转发 13 · 回复 17 · 浏览 15322
用 blender 做视频应该会成为新的模型测试基准,鹈鹕骑车已经不够用了,提示词(来自作者)很简单:
create a side by side video of rickroll & a version created w/ blender, use a subagents to verify your output as you go. Use web search to get necessary assets for the task.
Twitter/X · @dotey · 9月6日 16:25 UTC · 喜欢 539 · 转发 14 · 回复 16 · 浏览 69595
this is going to be my new “pelican on the bike” benchmark
we’re so early!
Twitter/X · @dotey · 9月6日 16:06 UTC · 喜欢 33 · 转发 2 · 回复 24 · 浏览 10573
研究 hermes 时发现了个惊喜:
@dotey 宝玉哥的 skill 已经是 hermes 官方默认 skill 包之一! https://t.co/euupqueBex
Twitter/X · @op7418 · 9月6日 15:53 UTC · 喜欢 63 · 转发 4 · 回复 10 · 浏览 12151
穷玩车,富玩表,顶富 astra 说你好 https://t.co/ehmvsxekn6
Twitter/X · @dotey · 9月6日 14:54 UTC · 喜欢 2366 · 转发 79 · 回复 75 · 浏览 1309731
okay Astra time to rickroll https://t.co/KvZdFZNew4
Twitter/X · @op7418 · 9月6日 14:23 UTC · 喜欢 37 · 转发 0 · 回复 24 · 浏览 15318
用我的 Windows 给这个用 GPT-6 Astra 做的 3D 游戏录了一个纯粹的演示
在 5070 Ti 的加持下,整个环境更加真实了,细节更多,而且超级流畅 https://t.co/YsvhUTaMW7
Twitter/X · @op7418 · 9月6日 07:56 UTC · 喜欢 29 · 转发 2 · 回复 21 · 浏览 12534
有朋友想玩一下、试一下吗?
想的话,我打包俩客户端给大家玩玩?
Twitter/X · @dotey · 9月6日 04:07 UTC · 喜欢 70 · 转发 0 · 回复 94 · 浏览 134802
同感,昨天我还剩两天自然重置,纠结了下还是用了,结果发现是顺延,感觉有点亏😅
Twitter/X · @dotey · 9月6日 03:46 UTC · 喜欢 69 · 转发 1 · 回复 109 · 浏览 70086
ChatGPT 有点太坑了, 用了重置卡重置日期还好顺延. 我还差一天, 这时候用掉性价比非常低, 真是离谱了. 这根本不能算重置 @thsottiaux https://t.co/c5ijf0u4e4
Twitter/X · @op7418 · 9月6日 03:00 UTC · 喜欢 26 · 转发 0 · 回复 26 · 浏览 9760
跟杨攀、橘子、乔木一起做了一个播客,叫 NEXT Token,拿下了昨天的小宇宙新星榜!
主要是借着当周的一些新闻,聊聊我们对这些事情的看法和认知。
一期大概一个多小时,非常像 AI 圈的谐星聊天会,后续也会有视频播客。
这一期尤其推荐厂商听,我们提了非常多关于模型厂商和大厂我觉得应该做的事情 https://t.co/93Q3srguGf
Twitter/X · @op7418 · 9月6日 02:26 UTC · 喜欢 32 · 转发 2 · 回复 22 · 浏览 28288
OpenAI Astra 发布视频在推特上居然有 1.25 亿的曝光。
在其他平台,那些搬运视频的曝光也很高。这宣传片做得太好了
中文标题Peter Yang 与 Brilliant 联合创始人讨论 AI 如何帮助孩子独立思考
Follow Builders · X 动态 · Peter Yang · 9月6日 14:53 UTC · 喜欢 36 · 转发 7 · 回复 11
A podcast episode about using AI to help kids learn, featuring Brilliant's co-founder, but lacks technical depth.
中文摘要这是一期播客推广,讨论 AI 在教育中的应用,但缺乏技术细节,属于营销内容。
中文标题关于 Apple 节目的闲聊
Follow Builders · X 动态 · Peter Yang · 9月6日 05:13 UTC · 喜欢 59 · 转发 1 · 回复 22
A casual comment about Apple's TV shows, lacking technical or professional relevance.
中文摘要一条关于 Apple TV 节目的随意评论,与用户关注的 AI 工具和开发者产品无关。
中文标题Nan Yu:每个科技初创公司的 logo
Follow Builders · X 动态 · Nan Yu · 9月6日 03:21 UTC · 喜欢 101 · 转发 1 · 回复 3
A post sharing a link to a collection of tech startup logos with no technical substance.
中文摘要一条仅分享科技初创公司 logo 链接的帖子,缺乏技术内容。
中文标题Peter Steinberger:记不清上次有如此大的能力提升
Follow Builders · X 动态 · Peter Steinberger · 9月6日 01:01 UTC · 喜欢 1756 · 转发 59 · 回复 66
一条关于 AI 能力大幅提升的模糊推文,缺乏具体细节。
中文摘要推文仅感叹 AI 能力大幅提升,未提供具体技术细节或可操作信息。
中文标题Peter Steinberger:在构建我想要使用的工具链上又近了一步,唯一缺的是……
Follow Builders · X 动态 · Peter Steinberger · 9月6日 00:51 UTC · 喜欢 755 · 转发 35 · 回复 54
Peter Steinberger 分享其开发工具进展,目标是秒级云会话,当前需改进快照机制。
中文摘要Peter Steinberger 分享了他构建的开发工具进展,目标实现秒级云会话,当前还需要优化快照机制。