公开免费版
Agent 栈今天从“模型能力”转向“可运营工作流”:OpenAI 推 GPT-5.6 Sol 的 750 tokens/s 与 Computer
🔭 今日主线
Agent 栈今天从“模型能力”转向“可运营工作流”:OpenAI 推 GPT-5.6 Sol 的 750 tokens/s 与 Computer History,Claude 把 Chrome session 接回全端,DeepSeek 同日发布 V4-Pro 与开源 Harness,Sequoia/LangChain/a16z 则把焦点压到 harness、eval、continual learning 和真实工作流验证。
今日扫描 319 个追踪实体 · 24 个 fetcher · 1098 条去重候选。AINews 与 TLDR 的外部答案卷也指向同一组信号:Claude Chrome Cowork、Grok 4.6、DeepSeek v4-Pro-0813,而不是单一模型 headline。今天真正重要的不是谁又发了一个更强模型,而是“模型如何被装进长期运行、能记忆、能评估、能接管真实流程的系统”。
对你最有用的判断:内容创业者下一阶段的护城河不是收藏 20 个新模型,而是把素材、判断、写作、分发、复盘变成可审计的个人 operating system。模型越来越快、越来越便宜,差距会落到你有没有自己的上下文、评估标准和反馈飞轮。
🎯 源头 · Primary
- OpenAI — 发布 GPT-5.6 builder guide,并预览 Ultrafast mode:由 Cerebras 驱动,GPT-5.6 Sol 最高 750 tokens/s,主打实时 voice、客服、commerce、coding、design、financial research 与 security response。重点是“速度成为产品能力”,不是单纯 benchmark。
- OpenAI — 推出 Computer History:ChatGPT desktop 可记住电脑上的 app / website activity,并提供 timeline、清除、排除、暂停等隐私控制。这是个人工作流记忆层,不只是聊天记录增强。
- Anthropic / Claude — Claude in Chrome 的 session 可跨 desktop、web、mobile 保存,skills/connectors 也带入浏览器;同时提醒 browser agent 会被网页隐藏指令诱导,安全边界成为产品体验的一部分。
- Google DeepMind — Gemini 3.7 Flash 强化 coding、knowledge work、web development,并在 debugging、issue resolution、web layout 等真实任务上提升;Demis 强调 introductory price 是 3.6 Flash 的一半。
- DeepSeek — 发布 DeepSeek-V4-Pro:强调 agent production gains、可调 reasoning effort、原生 OpenAI Responses API 支持;同时宣布 峰谷定价,off-peak 低 50%。这等于把 agent 负载调度直接写进商业模型。
- DeepSeek — DeepSeek Harness v0.1 Developer Preview 开源 MIT,面向 agent harness builders。中文侧创作者迅速把它理解为“毛坯房 + 插件系统”,这比 SDK 更接近用户行为数据入口。
- Mistral AI — 提出欧洲 AI capacity / open-source platform 路线:企业、政府、startup 可以把最好的模型接入自己的知识,并保留价值。这条线和美国闭源 agent 平台形成对照。
- Perplexity — Search as Code 优化后任务成本下降近 10%;Grok 4.6 进入 Perplexity Computer,并被放到 performance / efficiency Pareto frontier 上。
- OpenClaw — 今日稳定基线仍是 v2026.7.1-2,并继续围绕 agent 改变软件开发的方向做社区沟通。
- 本日发布 — OpenCode v1.18.18、Zed v1.16.0-pre、Cline cli-v3.0.54 与 Cline SDK v0.0.74 都在小步迭代,agent tooling 的周更节奏还在加速。
💰 投资 · Investor
- a16z — 投资 Vals:判断是 frontier model 在 leaderboard 上漂亮,不等于能证明它做得了真实工作;独立 evaluation layer 会成为 AI adoption 的关键基础设施。
- Sequoia / LangChain — Harrison Chase 在 When to Build Your Own Agent Harness 里把“own your intelligence”拆成 open agent system、context、compounding loop;Sequoia 同场还把 continual learning、post-training、RL environments 连成一条企业智能资产路线。
- Sequoia / Trajectory — Arjun Karanam 在 continual learning talk 里说模型有 IQ 但没有 tenure,企业要保留 trace、eval、harness 与真实交互数据,才能让 agent 越用越懂业务。
- a16z / Datadog — Datadog CISO 访谈 的重点不是“要不要用 AI agent”,而是如何用 role-based MCP、ephemeral credentials 和 AI judge 让 4000+ 工程师安全使用 coding agents。
- Arize / Dynatrace — Arize 宣布被 Dynatrace 收购,Foundation Capital 提到交易约 $915M。这说明生产 AI observability / eval / drift 问题已经从工具层进入大型平台整合。
- Databricks — TechCrunch 报道 Databricks 最终以 $190B valuation 融资 $5B。资本押注的是数据平台成为模型、agent、企业 workflow 的承载层。
🧠 解读 · Sense Maker
- AINews / TLDR — 今日外部摘要把 Claude Chrome Cowork、Grok 4.6、DeepSeek v4-Pro-0813 放在同一组 headline。它们共同指向“agent 进入真实浏览器、真实 harness、真实成本约束”。
- 量子位 — 深度体验 DeepSeek Harness 的角度是“涨价可以被原谅吗”:如果 Harness 真能把 agent workflow 和插件生态跑起来,模型厂商就不只卖 token,而是在争夺使用入口。
- Harrison Chase — harnesses & evals 的核心判断是:你要拥有 agent system、context、compounding loop。对一人公司来说,这句话可以翻译成“别只买工具,要沉淀自己的流程数据”。
- Ethan Mollick / Brynjolfsson — 更新版 Canaries in the Coal Mine 仍未看到广泛 AI job displacement,但 AI-exposed jobs 里的年轻人相对下滑扩大到 19%。这不是失业恐慌题,而是“入门工种的学习路径被改写”。
- Boris Cherny — Claude Code sessions 可以命名并互相 DM;另一个判断是 LLM bug 从 off-by-one 转向 system design、UI usability、缺 broader context。这对你的产品开发很直接:agent coding 的瓶颈正在从“会不会写代码”转向“会不会理解系统”。
- Sierra — Defense in depth in the age of agents 把 flow-based agents 和 goal/guardrail agents 区分开:越往目标驱动走,越需要多层防御和可恢复控制。
🔨 实践 · Practitioner
- DHH — 用 Grok 4.6 复现 Fable 计划,约 1h24m、8.6M tokens、成本约 $55。他的另一个点是 Rails 也开始系统评估 coding performance;实践者关心的是“用多少钱把真实任务做完”。
- Cursor — Firetiger joins Cursor:两边要做能把变更带到 production、观察行为、出错后响应的 long-running autonomous agents。coding agent 从 IDE 内补全走向生产闭环。
- Cline — 把 DeepSeek V4-Pro 0813 接进 ClinePass,并称其 Terminal Bench 相比 April Preview 提升 15.8%,以很低成本逼近 Fable 5 表现。这里的信号是模型价格下降会立刻改写 coding agent 默认路由。
- Tianyi Cui — DeepSeek Harness 0.1.0 被定位为 developer preview,承认 rough edges,但开放反馈。这比完美发布更像 agent infra 生态的早期真实状态。
- Hiten Shah — AI 迫使我们把 judgment reusable。这句话适合贴在你的内容系统墙上:AI 内容创业不是把文章外包给模型,而是把你的判断标准产品化。
- Eugene Cheng / LinkedIn — 简历优化 prompt 仍是大众 AI 高需求;但同池里也出现 “AI 改简历导致传统招聘失灵” 的视频。就业/招聘是内容创业者能长期吃的场景,不是一次性工具分享。
🔥 专业热榜
- GitHub Trending — anthropics/skills、msitarzewski/agency-agents、holaboss-ai/holaOS、NVIDIA-NeMo/Switchyard 都落在 agent workflow / skills / orchestration 方向。
- HN — Mistral OCR 4.1 上榜,说明“文档理解 + structured extraction”仍是企业 agent 的硬基础,不是性感 demo。
- Hugging Face — DeepSeek V4 Pro、MiniMax Music 3、Muse Glimmer 等开放模型集中出现;开源/开放权重继续把模型层的优势压缩到更短半衰期。
- Product Hunt — 今日工具流里更值得看的不是单点小工具,而是“面向具体岗位的 workflow 封装”:招聘、设计、研究、文档处理、agent scheduling。
👥 我的 feeds
- LinkedIn — OpenAI Deployment Company 这样的表述开始出现:AI 公司的工作重心从模型发布转到部署、流程、组织改造。
- LinkedIn — FLORA Studios 把 fashion team 的 sketch-to-render、garment swap、recolor、print placement、model generation、try-on 放进一个 cohesive tool。垂直创意工作流比泛图片模型更接近付费场景。
- LinkedIn — 2 人团队 $3M ARR 和 “AI companies revenue per employee” 继续刷屏;噪音很大,但需求很真:大家想知道 AI-native 小团队到底能跑到什么经营密度。
- X / LinkedIn — 多条关于 DeepSeek、Gemini、Grok 4.6、Cursor/Firetiger 的内容被算法流推到前排,说明 agent workflow 已经不是小圈子 infra 话题,而在扩散到更宽的 builder feed。
🌶️ 热点
- DeepSeek V4-Pro + Harness 是中文侧今天最强热点。 歸藏连续跟进 V4-Pro 0813 发布、官方公告与涨价、Harness 公测节奏;数字生命卡兹克则从安装、GitHub 地址、插件玩法到“毛坯房”心态完整拆了一轮。
- 涨价争议其实是产品定位争议。 中文创作者的核心反应不是“贵了”,而是:如果 DeepSeek 做 Harness,它是在从模型供应商转成 agent 产品入口;涨价、峰谷定价、插件系统会一起影响开发者要不要把 workflow 放上去。
- 内容创业侧的小爆点仍在就业 / 简历 / AI 求职。 课代表立正的 AI 改简历与传统招聘失灵 是今天中文视频侧少数可见信号。它的选题价值不在“教你用 AI 改简历”,而在“AI 让信号筛选失灵后,个人如何重建可信作品集”。
- AI 接单赚钱仍有市场,但要避开低质财富话术。 数字生命卡兹克转发 10w+ AI 博主分享接单方法,这类题材能吸引内容创业者,但你要写成系统方法论,别写成“AI 副业暴富”。
- 今日 CN 平台搜索缺失。 rednote / B站 / 抖音搜索全 0,所以本段主要来自 X 上的中文信任创作者和 YouTube creator,不代表完整国内平台热度。