Twitter/X · @dotey · 8月14日 18:22 UTC · 喜欢 85 · 转发 11 · 回复 21 · 浏览 19418
这篇 Pi 压缩的文章,太过于朴实无华,就真的只是写个 prompt 让 LLM 把上下文总结一下,然后保留前面的 system prompt 和工具调用,在摘要后可能还会保留最近几次对话。
这种压缩是有损的,不知道是不是有机制会去历史会话检索上下文?
当然这确实是压缩上下文的最简单有效方案。
面向 AI 建设者、工程实践与产品趋势的中文个人情报雷达
从 64 条内容中筛选出 15 条重要资讯。
北京协和医学院的一名神经外科博士生金山木,其本科专业为地质学,据称使用 AI 模型 GPT-5.6 解决了矩阵分析领域一个核心的未解难题——2004 年提出的 Crouzeix 猜想。据报道,该证明已得到猜想提出者 Michel Crouzeix 本人及其他数学家的确认。 这标志着一个潜在的范式转变,表明先进的人工智能可以直接助力解决纯数学中长期存在的基础性问题。它凸显了 AI 作为科学发现协作工具日益增长的作用,并可能降低跨学科研究者的参与门槛。 据报道,该学生使用的是 OpenAI 于 2026 年 7 月发布的大语言模型系列 GPT-5.6,该系列包含 Sol、Terra 和 Luna 等不同变体。Crouzeix 猜想涉及为矩阵多项式与其数值域相关的范数建立一个普适的上界,这是算子理论和数值线性代数中的一个基本问题。
twitter · 刘江/LIU Jiang · 8月14日 03:58
核验: 多源印证
背景: 矩阵分析是数学的一个分支,专注于矩阵的性质和应用,与处理涉及矩阵的算法计算的数值线性代数密切相关。Crouzeix 猜想由 Michel Crouzeix 于 2004 年提出,是该领域一个关于矩阵多项式范数的著名未解问题。GPT-5.6 是由 OpenAI 开发的最先进的大语言模型,以其高级推理和问题解决能力而闻名。
社区讨论: 讨论既包含对该故事励志层面的浓厚兴趣,也对其个人背景提出了疑问,提及了其过去的升学途径和博士论文争议。这表明了人们对 AI 成就的兴奋与对个人叙述的审视并存。
标签: #AI Research, #Mathematics, #GPT-5.6, #Breakthrough, #AI Agents
阿里通义千问团队开源了 Qwen3.8 系列模型,其中 Qwen3.8-27B 是一个拥有 270 亿参数的原生多模态稠密模型,其性能全面超越了前代 Qwen3.7-Plus。该模型原生支持 262K 上下文长度,可通过 YaRN 技术扩展至 1M tokens,并采用 Apache 2.0 许可协议发布。 此次发布为开源社区提供了一个能力强大、可商用的模型,它在编码、长上下文任务和多模态推理方面表现出色,且参数量相对较小。这标志着前沿 AI 能力走向普及化的重要一步,挑战了美国大公司的专有模型,并为全球开发者提供了先进且易获取的工具。 Qwen3.8-27B 模型原生支持 262K 上下文,并可通过 YaRN 技术扩展至 1M tokens,这使其在处理长文档或视频方面具有优势。团队还同步发布了超大规模模型 Qwen3.8-2.4T-A95B(Max 级)的开放权重,不过要充分利用其全部能力可能需要巨大的计算资源。
aihot · X:通义千问 / Qwen (@Alibaba_Qwen) · 8月14日 15:02 · 中文阅读 · 2 个来源
核验: 多源印证
背景: 通义千问(Qwen)是阿里云开发的一系列大语言和多模态模型。Apache 2.0 许可证是一种宽松的开源许可,允许商业使用、修改和分发,因此成为 AI 模型发布的热门选择。YaRN(Yet another RoPE extensioN method)是一种高效的技术,用于扩展基于 Transformer 的模型的上下文窗口,而无需完全重新训练,这对于处理长序列至关重要。
社区讨论: 社区反响非常积极,用户赞扬了模型的推理能力和在特定基准测试中的表现,指出它在其他模型失败的任务上取得了成功。一些用户强调了令人印象深刻的实践结果,例如根据描述生成详细图像,而另一些用户则讨论了实现更快推理的技术优化。更广泛的讨论围绕着高端 AI 能力的快速普及化及其对主要专有模型提供商的潜在影响展开。
标签: #AI Models, #Open Source, #Multimodal AI, #Large Language Models, #Developer Tools
智谱 AI 于 2026 年 8 月 14 日发布了 GLM-5.3,该模型与 GLM-5.2 共享同一个 7430 亿参数的基座模型,所有性能提升均来自后训练阶段的强化学习。该模型在多个编程基准测试中取得开源模型最高分,并在训练过程中意外地涌现出自主规划漏洞利用链的能力。 此次发布确立了开源模型在编程和长周期智能体任务上的新标杆,缩小了与顶尖闭源模型的差距。更重要的是,模型未经专门训练就涌现出的漏洞利用链规划能力,预示着 AI 驱动的网络安全领域可能出现范式转变,同时也对强大开源 AI 模型的安全性和双重用途提出了重要的考量。 GLM-5.3 在 Terminal Bench 3.0 上的得分从 GLM-5.2 的 4.6 分跃升至 28.3 分,在白盒代码审计基准 CyberGym 上取得了 84.5%的分数,超过了部分闭源模型。该模型的权重将在大约两周后以 MIT 许可证公开发布,并且已被用于在 269 个开源项目中发现了 2,436 个真实漏洞。
twitter · 宝玉 · 8月14日 05:50 · 4 个来源
核验: 多源印证
背景: GLM-5.3 是智谱 AI 大语言模型系列的一部分。后训练强化学习是在初始预训练阶段之后使用的一种技术,旨在进一步使模型的行为与期望目标(如遵循指令或生成有用的代码)对齐。Terminal Bench 3.0 等基准测试用于评估 AI 在终端环境中执行复杂多步骤任务的能力,而 ExploitBench 和 CyberGym 则是专门用于评估 AI 在漏洞发现和利用方面能力的基准测试。
社区讨论: 社区讨论指出,该模型的改进重点在于安全能力和长周期任务执行,例如终端操作和大代码库修复。人们对于仅通过对同一基座模型进行多版本的后训练扩展就实现如此显著的性能提升感到惊讶和赞赏。
标签: #AI Models, #Open Source, #Reinforcement Learning, #Code Generation, #AI Security
AI 驱动的代码编辑器 Cursor 已被 SpaceX 正式收购,完成了自 4 月启动的收购流程。合并后,Cursor 将获得据称是全球最大的 GPU 集群,用于构建更强大且更具成本效益的 AI 模型,而最新发布的 Grok 4.6 就是双方合作的早期成果。 此次收购标志着一项重大战略举措,一家领先的 AI 开发工具与科技巨头的庞大计算基础设施相结合。这可能会加速开发更先进、更实惠的 AI 编码智能体,从而可能重塑软件开发工具的格局,让更强大的 AI 辅助功能对开发者而言更加触手可及。 此次收购使 Cursor 能够使用 SpaceX 庞大的 GPU 资源,预计将降低其 AI 模型的运行成本。交易后不久发布的 Grok 4.6 模型被强调为第一个具体成果,展示了其在长周期智能体和交互式工作方面改进的能力。
aihot · Cursor Blog · 8月14日 12:00 · 中文阅读
核验: 多源印证
背景: Cursor 是一个 AI 驱动的集成开发环境(IDE),其功能超越了简单的代码补全,可以作为一个编码智能体,理解代码库、规划功能并修复错误。SpaceXAI 是 SpaceX 旗下的人工智能部门,以开发 Grok 系列 AI 模型而闻名,该系列是具有高级推理和编码能力的聊天机器人。双方的合作最初于 4 月宣布,旨在加速模型训练,最终促成了此次全面收购。
标签: #AI Developer Tools, #Mergers and Acquisitions, #AI Code Generation, #SpaceX, #Product Announcement
一篇详细分析和一场高参与度的社区讨论指出,与之前的版本相比,Anthropic 的 Claude Opus 5 模型对人类开发者来说感觉更不直观、更啰嗦。用户报告称,它的写作风格过于抽象、迂回,并且经常偏离指令。 这种开发者体验的下降暗示了 LLM 设计可能发生了战略转变,即优化 AI 智能体间的通信可能被置于比人类可用性更优先的位置。如果属实,这一趋势可能会扩大开发者的可用性鸿沟,并影响未来模型的训练和评估方式。 该模型在技术任务上被描述为能力更强,但其语言啰嗦、带有忏悔性质,并且倾向于使用无生命名词作为句子主语以达到某种文体效果。一些开发者已切换回 Claude 4.8 或 OpenAI 的模型,以获得更好的工作流体验。
hackernews · numeri · 8月14日 10:12 · 社区讨论
核验: 多源印证
背景: Claude Opus 5 是 Anthropic 于 2026 年 7 月发布的最新主要语言模型,被宣传为一款强大的智能体编码模型,专为长期、多步骤的工作而构建。更广泛的 AI 行业正在积极研究语义驱动的通信和上下文压缩技术,以优化 AI 智能体之间的交互,这可能涉及与人类可读输出之间的权衡。LLM 的可用性通常需要在原始能力、成本以及有效与模型交互所需的认知负荷之间取得平衡。
社区讨论: 社区情绪主要批评 Opus 5 的沟通风格,用户形容其令人疲惫、迂回且不必要的抽象。一个突出的推测是,该模型的后训练现在可能针对 AI 智能体通信(’智能体语言’)进行了优化,而非针对人类开发者,这解释了用户体验的下降。一些评论者报告称,由于这些可用性问题,他们已回退到旧模型或转向了竞争对手的产品。
标签: #AI Agents, #LLM Usability, #Developer Experience, #Anthropic Claude, #AI Tooling
谷歌宣布在同态加密技术应用方面取得重大进展,该技术允许直接在加密数据上进行计算而无需先解密,这使私有 AI 走向实用化。 这一进展意义重大,因为它实现了隐私保护的机器学习,允许 AI 模型处理敏感数据而无需暴露原始信息,这可能影响医疗和金融等行业。这是在协调 AI 能力与日益增长的数据隐私需求方面迈出的关键一步。 正如社区讨论所指出的,一个主要的限制是同态加密技术历来会产生非常高的计算开销,估计推理任务速度会减慢高达 1000 倍,这限制了其商业可行性。谷歌的公告表明他们正在努力将这种开销降低到更实用的水平。
hackernews · u1hcw9nx · 8月14日 15:43 · 社区讨论
核验: 多源印证
背景: 同态加密是一种加密形式,允许在加密数据上执行计算,而无需先对其进行解密。这对于“私有 AI”或隐私保护机器学习至关重要,其目标是在不暴露原始敏感信息的情况下对数据进行模型训练或运行。全同态加密(FHE)是一种特定类型,允许对加密数据进行任意计算。由于其在实现安全云计算和数据分析方面的潜力,该领域一直是研究的热点。
社区讨论: 社区讨论揭示了技术上的怀疑态度以及对谷歌隐私立场的更广泛批评。在技术层面,评论者强调了同态加密历来存在的高计算开销(例如,速度减慢约 1000 倍),质疑其直接的商业可行性。另一些人则表达了讽刺或不信任,指出谷歌作为“反隐私”公司的声誉,并指出其其他产品中存在的隐私缺陷,例如其密码管理器默认不提供端到端加密。
标签: #AI Privacy, #Homomorphic Encryption, #Google Research, #Machine Learning, #Security
Z.ai 发布了 GLM-5.3,这是一个新的 AI 模型,在自动化安全研究(包括漏洞发现和执行红队/蓝队场景)中展现出涌现能力。它基于与 GLM-5.2 相同的基座模型,所有改进均来自后训练。 这标志着 AI 在执行复杂的、多步骤的攻防安全任务方面的能力取得了重大进步,可能降低漏洞发现的成本并扩大其规模。这使 GLM-5.3 成为编码和基于智能体的网络安全应用领域的领先开源模型。 该模型已展示出执行复杂攻击链的能力,包括利用 WordPress 插件零日漏洞和适配内核漏洞利用,同时也能模拟防御行动。它在 Z.ai Code Bench 上比 GLM-5.2 提升了 50%,并在 Terminal-Bench 3.0 等基准测试中创造了新的开源最先进结果。
hackernews · pella · 8月14日 05:19 · 社区讨论
核验: 多源印证
背景: AI 中的涌现能力指的是在训练过程中未明确编程、却突然出现的重大新能力。在网络安全中,红队演练模拟攻击以发现漏洞,而蓝队演练则专注于防御;两者共同构成了测试安全态势的关键实践。GLM 系列是由 Z.ai 开发的大型语言模型,GLM-5.3 是其最新的旗舰模型,专注于编码和长程任务。
社区讨论: 社区情绪非常积极,用户报告了该模型在真实世界安全研究场景中的突破性表现,例如让模型对一个防御性的 GLM 智能体执行红队攻击。一些用户指出它已接近 Sol 和 Fable 等竞争模型,而另一些用户则赞赏其公告以研究为导向的基调。社区还讨论了该模型进行大规模自动化漏洞扫描的潜力,一个相关的漏洞披露门户网站也印证了这一点。
标签: #AI Agents, #Code Generation, #Cybersecurity, #Large Language Models, #Developer Tools
一项基于团队讨论的详细分析揭示,AI 编程工具生成代码的速度过快,导致开发者可能不清楚构建了什么,从而破坏了传统的软件工程反馈循环。这导致进度模糊不清,调试和集成时间增加,沟通成本上升,尽管最初看起来完成得更快。 这很重要,因为它凸显了 AI 辅助开发中一个关键的新兴风险:为了原始速度而牺牲代码可追溯性和人类理解,最终可能降低整体工程效率和软件质量。分析认为,软件开发的下一轮竞争优势将不是更快的 AI,而是建立能够保持清晰度、可验证性和人类监督的新流程。 作者指出,一个五天的任务在 AI 生成后第一天可能看起来就“完成”了,但剩余四天的工作常常转化为大量的修复 Bug 和回归测试。一个关键见解是,生成速度不等于功能或工程上的完成,这要求人类主动创建用于理解和验证的检查点。
twitter · 凡人小北 · 8月14日 16:20
核验: 多源印证
背景: AI 编程工具,如 GitHub Copilot、Claude Code 和 Cursor,使用大语言模型通过生成、补全或解释代码来辅助开发者。在软件工程中,反馈循环是为开发者提供关于其工作信息的机制,从即时语法错误到长期用户验证,这对于学习、迭代和保持质量至关重要。代码可追溯性是指理解代码变更的起源、原理和影响的能力,当 AI 生成大量不透明的代码块时,这一概念受到了挑战。
标签: #AI Coding, #Software Engineering, #Developer Workflow, #AI Agents, #Productivity
Amjad Masad 宣布,仅仅通过添加一个编程框架,ARC-AGI-3 基准测试就接近被解决。这一进展支持了之前的预测,即进行编程任务有助于大型语言模型(LLM)泛化其能力。 这具有重要意义,因为它表明在复杂的、交互式 AI 推理基准测试上取得高性能可能有一条更简单的路径,这些基准测试旨在衡量智能体智能和泛化能力。如果得到验证,通过利用代码生成框架,它可以加速开发更强大、更高效的 AI 智能体。 这一说法基于初步结果,具体的’编程框架’解决方案的实现细节或性能分数尚未公开。ARC-AGI-3 是一个交互式基准测试,用于评估智能体在全新环境中通过探索和规划进行学习的能力,因此通过编码解决它是一个值得注意的技术见解。
follow_builders · Amjad Masad · 8月14日 04:45
核验: 多源印证
背景: ARC-AGI-3 是第三代抽象与推理语料库(ARC)基准测试,被设计为针对 AI 智能体的交互式推理测试。它挑战智能体在全新的抽象环境中,通过行动和反馈来学习不熟悉的任务机制,侧重于流体的自适应效率。AI 编程框架是一个位于 LLM 之上的编排层,它协调智能体、管理项目上下文,并根据真实的构建和测试来验证代码输出。
标签: #AI Agents, #LLM Benchmarking, #Code Generation, #AGI Research, #Developer Tools
小红书 Dots 模型实验室开源了 dots3-note Preview 模型,这是 dots3 系列的首个开源版本。该模型总参数量为 2800 亿,激活参数量为 160 亿,支持 512K 上下文长度,具备文本、视觉和语音多模态理解能力,并针对复杂推理和长程智能体任务进行了优化。 此次发布为开源社区提供了一个强大的、专门用于构建需要长期记忆和多模态推理的复杂 AI 智能体的模型,直接应对了开发实用、长周期 AI 应用的一个关键挑战。这标志着大型科技公司开始向开源生态贡献先进的、以智能体为中心的模型,可能加速在自主助手和复杂工作流自动化等领域的创新。 该模型采用了“显式推理模式”,这可以提升复杂问题的解决能力,但可能会增加延迟和令牌消耗。它被定位为面向复杂专业工作负载的“Dots Studio 模型”,并且自 2026 年 8 月中旬起已在 Writingmate 等平台上线。
aihot · 公众号:小红书技术(dots.llm) · 8月14日 11:25 · 中文阅读
核验: 多源印证
背景: 大语言模型是在海量数据上训练的 AI 系统,其中的“参数”是模型在训练过程中调整以进行预测的内部变量。“激活参数”指的是对于给定输入被显著调用的那部分参数,它们影响着模型的具体输出和效率。“长程智能体”是指设计用于在长时间交互或处理长文档的 AI 系统,它们需要诸如检查点等技术来在标准上下文窗口限制之外保持连贯状态,这对于实现现实、持久的应用至关重要。
标签: #AI Agents, #Large Language Models, #Open Source, #Multimodal AI, #Developer Tools
Hugging Face 对 2026 年前八个月的分析显示,模型下载量高度集中,1.5%的仓库占据了 99.2%的下载量。报告还指出,中国实验室发布的最大模型参数规模高达 2.78 万亿,而 AMD 和 NVIDIA 各自发布了超过 200 个新模型仓库,成为发布量最多的机构。 这揭示了开源 AI 生态中“赢家通吃”的动态,即极少数模型吸引了几乎所有的使用。中国实验室在规模上的领先地位,以及主要芯片制造商在发布上的主导地位,标志着竞争格局的变化,也体现了开源模型对硬件供应商的战略重要性。 报告指出,85.6%的模型下载量不足 200 次,表明存在大量未被充分利用的“长尾”模型。中国实验室月度最大模型参数规模在 7540 亿至 2.78 万亿之间波动,而美国实验室在七个月中有五个月的最大规模低于 1300 亿。
aihot · Hugging Face:Blog(RSS) · 8月14日 00:00 · 中文阅读
核验: 多源印证
背景: Hugging Face Hub 是一个用于托管和共享机器学习模型、数据集及应用程序的中心化平台,它使用 Git 仓库进行版本控制。模型参数指的是训练过程中学习到的权重,更大的模型(如提到的 2.78 万亿参数的 Kimi K3)通常具有更强的能力,但也需要更高的计算成本。下载量的集中反映了社区倾向于聚集在少数高质量或知名的模型上。
标签: #AI Models, #Open Source, #Industry Analysis, #Machine Learning
Anthropic 宣布,未来的 Claude 模型将在生成的文本中嵌入不可见的水印,用于判断文本由 Claude 撰写的可能性。这一基于 Google DeepMind 的 SynthID-Text 技术的实施,是为了遵守欧盟《AI 法案》而进行的变更,已于 8 月 2 日生效。 此举意义重大,因为它代表了一家主要的 AI 提供商主动调整其技术以满足关于内容认证和透明度的新监管要求。它开创了在不降低用户体验的前提下大规模识别 AI 生成内容的先例,可能成为合规与信任领域的行业标准。 该水印方法的工作原理是在文本生成过程中微调 token 的概率分数,从而形成一种可检测的模式,且不影响输出质量、创造力或可读性。关键点在于,水印对读者而言是不可感知的,不会为输出增加额外的 token,也不会提高生成成本。
aihot · Anthropic:Newsroom(网页) · 8月14日 19:22 · 中文阅读
核验: 多源印证
背景: 欧盟《AI 法案》于 2024 年 7 月发布,是欧盟针对人工智能的综合性监管框架,根据不同的风险等级制定了相应规则。针对 AI 模型的文本水印技术,例如 Google 的 SynthID-Text,涉及在生成内容中嵌入一种细微的、机器可检测的信号,以识别其 AI 来源,同时不改变人类可感知的质量。这有助于解决关于错误信息和内容来源的担忧。
标签: #AI Ethics & Safety, #Claude, #AI Regulation, #Content Authentication, #AI Developer Tools
对新发布的 DeepSeek Harness 进行的数据分析显示,其插件系统与 Koishi 平台的相似度高达 75%,主干 PR 中有 21.2% 由 Codex 命名,该项目在 65 天内产出了 84 万行代码。该项目在发布后 20 小时内 GitHub star 数超过 8 万,并发表了一篇 88 页的学术论文。 该分析为一个主流开源 AI 智能体框架背后快速、AI 辅助的开发实践提供了具体证据,突显了行业可能向高度自动化、数据驱动的软件工程转变的趋势。巨大的社区采用率和插件生态增长,表明了开发者对可组合、基于插件的智能体架构的强烈兴趣。 分析指出,虽然已有 1425 个项目使用了 ‘DSH plugin’ 标签,但其中许多并非真正的插件,这表明存在蹭热度的行为。此外,团队最初同时支持 TUI 和 Web UI,但后来删除了所有 TUI 代码,完全转向基于网页的界面。
twitter · 歸藏(guizang.ai) · 8月14日 09:40 · 2 个来源
核验: 多源印证
背景: DeepSeek Harness 是深度求索公司推出的开源智能体框架,基于“万物皆插件”的架构,与 LangChain 等传统框架不同。Koishi 是一个以其插件系统闻名的跨平台聊天机器人框架。Claude Code 是 Anthropic 公司推出的 AI 编码助手,可帮助进行代码分析、编辑和 Git 自动化。
社区讨论: 伴随分析发布的推文表达了启发之意,指出 DeepSeek Harness 促使人们重新考虑之前的技术选择,并强调了开源创新在推动新视角方面的价值。
标签: #AI Agents, #Developer Tools, #Code Analysis, #Open Source, #Product Launch
Doug Turnbull 在一篇博客文章中描述了一种技术:提示大型语言模型为内容发明新的标签,然后使用向量嵌入将这些’幻觉’生成的标签映射到大型、预先存在的分类体系中最接近的匹配项。这种方法避免了将整个标签词汇表直接提供给 LLM 进行分类的需求。 这种方法意义重大,因为它为使用广泛、预定义的分类体系对大量内容进行追溯性标记提供了一个实用且可扩展的解决方案,这是内容管理和电子商务中的常见挑战。它创造性地利用了 LLM 的生成能力和向量搜索的语义匹配能力,来自动化复杂的分类任务。 提示词会指导 LLM 以特定的分层格式生成分类,并使用示例来引导输出结构。其核心创新在于两步流程:首先,不受现有列表约束地生成假设性标签;其次,使用向量相似性搜索来寻找与生成标签在语义上一致的真实标签。
rss · Simon Willison · 8月14日 21:54
核验: 多源印证
背景: 向量嵌入是数据(如单词或文档)的密集数值表示,能够捕捉语义含义,使得相似的项目在向量空间中位置接近。传统的基于 LLM 的分类通常涉及向模型提供可能的类别列表(分类体系)并要求其选择一个,这在分类体系非常庞大时变得不切实际。提示工程涉及设计指令来引导 LLM 针对特定任务(如分类)的输出。
标签: #LLM, #Vector Search, #Content Tagging, #AI Automation, #Developer Tools
一位开发者在将其工具 ‘Mole’ 从面向工程师的命令行界面 (CLI) 演进为易用的 Mac 桌面应用后,分享了来自国际用户的详细反馈。这些反馈涵盖了文化适配(如温度单位默认值)、定价心理学、无障碍需求以及教育用途等多个方面。 这很重要,因为它为开发者和产品构建者提供了关于将技术工具过渡到大众市场产品时所面临的挑战和机遇的具体、真实的见解。它强调了来自全球多样化用户的直接反馈对于改进可用性、文化相关性和定价策略至关重要,最终有助于打造更成功、更具包容性的产品。 具体经验包括:在美国市场,技术工具应默认使用摄氏度;价格以 9 或 5 结尾在心理上更易被接受;为满足无障碍需求,需要提供明暗模式配置选项;以及教育定价的价值。该工具 ‘Mole’ 被定位为类似 CleanMyMac 等系统工具的替代品。
twitter · Tw93 · 8月14日 14:40
核验: 多源印证
背景: 命令行界面 (CLI) 是一种基于文本的与软件交互的方式,通常由开发者和技术用户使用。CleanMyMac 是一款知名的商业 macOS 系统优化和清理工具,常被用作同类工具的基准。像 fastfetch 和 neofetch 这样的工具是显示系统信息的 CLI 程序,即使在美國,它们也通常在技术规格的温度读数上使用摄氏度。
标签: #Product Design, #Developer Experience, #User Feedback, #Internationalization, #Pricing Strategy
以下内容已于今日成功抓取,但未进入上方主列表。
Twitter/X · @dotey · 8月14日 18:22 UTC · 喜欢 85 · 转发 11 · 回复 21 · 浏览 19418
这篇 Pi 压缩的文章,太过于朴实无华,就真的只是写个 prompt 让 LLM 把上下文总结一下,然后保留前面的 system prompt 和工具调用,在摘要后可能还会保留最近几次对话。
这种压缩是有损的,不知道是不是有机制会去历史会话检索上下文?
当然这确实是压缩上下文的最简单有效方案。
Twitter/X · @dotey · 8月14日 16:44 UTC · 喜欢 65 · 转发 7 · 回复 16 · 浏览 5904
又小型做了一个工具类 Web 应用站的实验,几乎隔一天就是一个订单。 复盘总结一下,分享一种工具类快速赚小钱的打法:
找一个正在赚钱的行业,自己冲上去做。不过不是真做,而是“假装做这个行业”,然后把整个流程走一遍(我用 computer skill 直接让 AI 跑,然后 AI 会有很多 blocker 或 gate),这个时候 1/3👇 https://t.co/z4ZMPuXjFD
Twitter/X · @op7418 · 8月14日 16:39 UTC · 喜欢 6 · 转发 0 · 回复 17 · 浏览 3305
智谱发了一篇关于他们为 GLM-5.3 开源发布做准备的文章,主要是关于他们开源模型的网络防御观点:
网络防御能力不应该掌握在少数资源雄厚的机构手中,开源维护者、独立开发者和小型团队同样需要这些工具。
这次 5.3 版本大幅强化了网络安全任务的能力。
Twitter/X · @dotey · 8月14日 15:11 UTC · 喜欢 320 · 转发 22 · 回复 44 · 浏览 85550
Pi 作者对 DeekSeek Harness 评价 https://t.co/U7NcKf3AOn
Twitter/X · @op7418 · 8月14日 15:04 UTC · 喜欢 976 · 转发 90 · 回复 27 · 浏览 90002
https://t.co/fbjLdFGKez
Twitter/X · @dotey · 8月14日 14:55 UTC · 喜欢 65 · 转发 3 · 回复 28 · 浏览 19684
我不喜欢用 grill-me,可能因为我不擅长空想,也不喜欢被拷问。我需要那种看得见摸得着的东西才能进一步得出结论。
我更喜欢用 Claude Design 这种快速出一版原型,做出来一个真实的东西,才能感觉出来哪不对;或者 AI 写一份文档来理解方案,或者干脆 AI 实现一个 PoC 版本出来。
这在以前是很成本很高的事情,现在 AI 生成真的太容易了,所以对我来说不依赖 grill me 也还好。
Twitter/X · @op7418 · 8月14日 13:17 UTC · 喜欢 60 · 转发 7 · 回复 19 · 浏览 12664
今天的骑行到位了,夏天晚上骑真是容易胖。
这个视频是用我下面的这个运动分析 Skills 做的,支持徒步、骑行和跑步。
如果你也想这样分享你的运动轨迹,可以装一个试试 https://t.co/CFYnn0MCHg
Twitter/X · @dotey · 8月14日 09:01 UTC · 喜欢 1540 · 转发 60 · 回复 51 · 浏览 224304
I don't think the DeepSeek Harness is perfect but this is for sure the first time I have been looking at something new in the space and felt quite inspired to revisit some of our choices. I love that part about Open Source a lot!
Twitter/X · @op7418 · 8月14日 08:27 UTC · 喜欢 60 · 转发 3 · 回复 31 · 浏览 21850
GLM-5.3 发布了,看了一下,着重提升的主要是两部分:
1. 安全能力:看来 Hugging Face 在拿 GLM-5.2 防御了 OpenAI 的模型入侵以后,智谱也看到了这方面的价值,尤其是大家最近都在聊这块,他们针对性地做了一些优化。
2. 长程任务的执行:
比如终端里的任务、工具调用,以及大代码库的修复任务,都有非常大的提升。
这个模型依然是只进行了后训练,没有重新进行预训练。这都几个版本了,还能有这么大的提升,确实猛啊!
Twitter/X · @op7418 · 8月14日 07:54 UTC · 喜欢 130 · 转发 17 · 回复 17 · 浏览 23628
Twitter 完全开源了他们的推荐算法
用 Codex 分析了一下,感觉跟以前我们的认知还是有不少变化的。
总结了六条创作者应该做的事情:
1. 应该做值得转发的原创内容。
2. 尽量少用首贴写钩子,把重要内容放在第二条推串里这种发帖形式(这个和大家的认知不太一样,比较重要)。
3. 应该优先争取阅读、回复、引用和关注,点赞的权重其实没有那么高。
4. 拉开发帖间隔,不要频繁刷屏。
5. 深耕一个垂类,不要频繁更换账号类型。
6. 少做那些互动诱饵(比如互关、回复发送等),不要让别人讨厌你、对你点“不感兴趣”或举报。
Twitter/X · @dotey · 8月14日 07:52 UTC · 喜欢 101 · 转发 8 · 回复 9 · 浏览 30842
说真的, @mattpocockuk 的 grill-me,应该是我使用频率最高,同时也觉得最有用的 Skill 之一。
我在做产品和技术设计时,经常会用它来帮我检查,还有哪些地方没有真正想清楚。
很多时候,大的交互框架、产品流程和技术方向其实已经比较明确了,但往下落到细节,就会发现还有很多模糊的地方。有些是自己遗漏了,有些是之前压根没有想到,还有一些更常见的情况是,AI 已经给出了方案,甚至做出了 Mock UI,我看完却总觉得不太对。
麻烦就在这里。
我知道自己不满意,却又很难立刻说清楚,到底哪里有问题,以及我真正想要的是什么。
这时候我通常会先把目前的想法、目标和已有方案告诉 Agent,然后直接来一句:grill me。
接下来,Agent 就会开始不断盘问我。
它会沿着设计中的一个个分支继续往下问,把那些原本模糊的地方一点点挖出来:这个功能到底解决什么问题?这个状态应该怎么处理?用户为什么要在这里做这个动作?两种方案之间你真正看重的是什么?
很多问题,我其实从来没有认真想过。
而在一轮轮回答这些问题的过程中,原本只是脑子里一个模糊的感觉,会逐渐变成非常具体的产品决策。
这也是我觉得 grill-me 最有价值的地方。
有时候你缺的并不是 AI 再给你一个方案,而是有人不断追问,帮你把自己真正想要的东西想明白。
Twitter/X · @op7418 · 8月14日 05:17 UTC · 喜欢 17725 · 转发 2188 · 回复 847 · 浏览 4074176
Introducing GLM-5.3: Built to Code. Ready for Cyber Defense.
- Top-tier coding and agentic capabilities, achieved through post-training on the 743B base model
- A major leap in cybersecurity, setting a new standard among open models
Tech Blog: https://t.co/ekQkO83jCv https://t.co/y3Y2AB0wxr
中文标题Thibault Sottiaux:让 ChatGPT 吐槽你一天后的电脑使用情况
Follow Builders · X 动态 · Thibault Sottiaux · 8月14日 05:21 UTC · 喜欢 1280 · 转发 59 · 回复 221
A user describes a humorous and insightful method of using a ChatGPT plugin to analyze and critique one's daily computer usage patterns.
中文摘要用户描述了一种使用 ChatGPT 插件来分析和幽默点评个人每日电脑使用模式的方法。
中文标题Swyx:顶尖新加坡人同意
Follow Builders · X 动态 · Swyx · 8月14日 04:28 UTC · 喜欢 3 · 转发 0 · 回复 0
A tweet with a vague title linking to unspecified content about Singaporeans agreeing on something.
中文摘要一条标题模糊的推文,链接到关于新加坡人对某事达成共识的未指明内容。
中文标题Amjad Masad:这在 Replit 上当然是正确的。
Follow Builders · X 动态 · Amjad Masad · 8月14日 03:58 UTC · 喜欢 305 · 转发 4 · 回复 9
Amjad Masad states that an unspecified claim is true at Replit, linking to external content.
中文摘要Amjad Masad 表示一个未具体说明的说法在 Replit 上是正确的,并附有外部链接。
中文标题Amjad Masad:到明年,使用计算机将成为可选项。工作将发生根本性改变。
Follow Builders · X 动态 · Amjad Masad · 8月14日 03:49 UTC · 喜欢 717 · 转发 41 · 回复 153
Amjad Masad predicts that by next year, using a computer will become optional and work will undergo radical change, likely due to advancements in AI.
中文摘要Amjad Masad 预测,由于人工智能的进步,到明年使用计算机将变为可选项,工作将发生根本性变革。
中文标题Peter Yang:如今人们在产品规格说明中会加入什么内容,使其对人和 AI 代理都友好且简洁?
Follow Builders · X 动态 · Peter Yang · 8月14日 03:39 UTC · 喜欢 7 · 转发 1 · 回复 6
A question about what to include in modern product specifications to make them friendly and concise for both humans and AI agents.
中文摘要一个关于现代产品规格说明应包含哪些内容,才能使其对人和 AI 代理都友好且简洁的提问。
中文标题Aaron Levie:淘汰工程师是最疯狂的假设之一,就像荒谬的错误一样。
Follow Builders · X 动态 · Aaron Levie · 8月14日 03:28 UTC · 喜欢 187 · 转发 20 · 回复 27
AI is a power tool that increases the value and demand for engineers by enabling them to tackle more and larger projects across various domains.
中文摘要AI 是一种强力工具,它通过使工程师能够处理更多、更大型的项目,从而提升了他们的价值和需求。
中文标题Thibault Sottiaux:在 ChatGPT 中直接使用 Google 文档、表格和幻灯片
Follow Builders · X 动态 · Thibault Sottiaux · 8月14日 03:21 UTC · 喜欢 1560 · 转发 84 · 回复 216
A user shares how integrating Google Docs, Sheets, and Slides directly into ChatGPT has streamlined their workflow for writing, brainstorming, and editing.
中文摘要一位用户分享了将 Google 文档、表格和幻灯片直接集成到 ChatGPT 中,如何简化了其写作、头脑风暴和编辑的工作流程。
中文标题Sam Altman:/ultrafast
Follow Builders · X 动态 · Sam Altman · 8月14日 03:12 UTC · 喜欢 1638 · 转发 68 · 回复 205
Sam Altman posts a cryptic tweet titled '/ultrafast' with a link, hinting at a potential new AI development.
中文摘要Sam Altman 发布了一条标题为“/ultrafast”并附有链接的神秘推文,暗示可能的新 AI 进展。
中文标题Zara Zhang:讽刺的是,许多人曾认为 AI 编程会降低工程师的价值,而现实中...
Follow Builders · X 动态 · Zara Zhang · 8月14日 02:18 UTC · 喜欢 106 · 转发 4 · 回复 29
The author observes that despite fears AI coding would devalue engineers, many high-demand roles still contain the word 'engineer'.
中文摘要作者观察到,尽管有人担心 AI 编程会降低工程师的价值,但许多高需求的职位仍然包含“工程师”一词。
中文标题Madhu Guru: AI 行业:这是一个无限创意的时代,感谢 AI。同样也是 AI 行业:我们都将把产品命名为'Studio'。
Follow Builders · X 动态 · Madhu Guru · 8月14日 01:25 UTC · 喜欢 12 · 转发 0 · 回复 2
A humorous observation that many AI products are using the word 'Studio' in their names.
中文摘要一个幽默的观察,指出许多 AI 产品都在其名称中使用'Studio'这个词。
中文标题Swyx: matt 的最新动态: https://t.co/Dnukubm9Yk thariq 的最新动态: https://t.co/BChJxtezPp 额外不要错过...
Follow Builders · X 动态 · Swyx · 8月14日 01:24 UTC · 喜欢 10 · 转发 0 · 回复 1
A tweet sharing links to three other creators' content, described as contributions to a discussion on frontier skills.
中文摘要一条推文分享了三位其他创作者关于前沿技能讨论的内容链接。
中文标题Swyx:人机交互成本高昂,因此在听取了 @mattpocockuk 和 @trq212 的建议后,我制作了一个 /align-me 修改版...
Follow Builders · X 动态 · Swyx · 8月14日 01:22 UTC · 喜欢 100 · 转发 0 · 回复 25
The author created an '/align-me' modification for AI tools that processes questions in batches instead of round-by-round, significantly speeding up design exploration workflows.
中文摘要作者为 AI 工具创建了一个'/align-me'修改版,支持批量处理问题而非逐轮交互,从而显著加快了设计探索工作流。
中文标题Garry Tan: 非常荣幸地接待我们希望成为加州下一任州长的@XavierBecerra,参加@garryslist 公民联盟聚会。
Follow Builders · X 动态 · Garry Tan · 8月14日 00:54 UTC · 喜欢 129 · 转发 6 · 回复 43
Garry Tan hosts a political gathering for a potential California gubernatorial candidate, discussing making the state business-friendly and affordable.
中文摘要Garry Tan 为一位潜在的加州州长候选人举办政治聚会,讨论如何使加州对企业友好且宜居。
中文标题Aditya Agarwal:如果能邀请@JeffDean 到@spc 进行炉边谈话就太棒了。我们如何实现?
Follow Builders · X 动态 · Aditya Agarwal · 8月14日 00:23 UTC · 喜欢 91 · 转发 0 · 回复 8
A user expresses a desire to host Jeff Dean for a fireside chat at SPC and asks for suggestions on how to arrange it.
中文摘要一位用户表达了希望在 SPC 邀请 Jeff Dean 进行炉边谈话的愿望,并征求实现此事的建议。