开源 / 低价模型正在把 agent 栈从“模型发布”推向“可运营系统”。今日扫描 315 个追踪实体 · 25 个抓取源 · 1079 条去重候选
🔭 今日主线
开源 / 低价模型正在把 agent 栈从“模型发布”推向“可运营系统”。今日扫描 315 个追踪实体 · 25 个抓取源 · 1079 条去重候选;最强的线不是单点模型炫技,而是 Qwen3.8、DeepSeek V4 Pro、Grok 4.6、Muse Glimmer 这些模型同时被 vLLM / SGLang / Cline / OpenCode / 本地桌面工具接住,变成可以被路由、量化、压测、计费、接入工作流的生产部件。
另一条线是控制层开始补账:OpenAI 讲企业从 assistance 到 execution,Anthropic 把 Claude in Chrome 会话、skills、connectors 打通,同时提醒浏览器 agent 会被网页隐藏指令攻击;a16z、Sequoia、Bessemer 都在讲 agent 的安全、post-training、evals 和组织改造。你今天要记住的判断:模型竞争重新白热化,但真正可变现的不是“又一个更聪明模型”,而是把模型接进可持续的 agent operating loop。
🎯 源头 · Primary
📦 本日发布
- OpenClaw〔S · harness〕— 📌 稳定版 v2026.7.1-2,继续作为个人 agent harness 的基线。
- vLLM v0.27.1〔A · infra〕— patch release 支持 quantized DSpark Markov heads;同日 vLLM 还给 Qwen3.8-2.4T-A95B 做 Day-0 serving recipe。
- Ollama v0.32.9〔A · infra〕— 本地模型运行栈继续滚动小版本。
- Cline v4.1.8〔A · dev_tools〕— Vertex model ID 可手填、支持 Fable 5 on Vertex;CLI/SDK 小版本修 stale Hub daemon。
- Zed v1.16.0-pre〔A · dev_tools〕— 支持 Gemini 3.6 Flash、Git panel grouped changes、Mermaid zoom。
- OpenCode v1.18.17〔A · dev_tools〕— 同日 X 侧宣布 DeepSeek V4 Pro 可在 OpenCode Go 使用。
模型 / 平台
- OpenAI〔S · model_maker〕— 企业研究把叙事从“AI 辅助”推进到“AI 执行”,点名 ChatGPT 和 Codex 正进入真实业务流程;同时 Daybreak models on AWS 扩分发,ChatGPT ads test 暗示消费端商业化开始试水。
- Anthropic〔S · model_maker〕— Fable 5 生物安全误拒下降约 85%;Claude 侧还把 Chrome 会话接到桌面 / web / mobile,并提醒 browser agent 的 hidden instruction 风险。
- xAI / Grok〔A · model_maker〕— Grok 4.6 发布,HN 与 Artificial Analysis 侧都把它放到 frontier intelligence / agentic performance 讨论中心;价格叙事是今天社交层扩散最快的点。
- Alibaba Qwen〔A · model_maker〕— Qwen3.8-2.4T-A95B 登上 HF / HN,vLLM 和 SGLang 同步 Day-0 支持;这更像“开放模型 + serving stack”联动发布。
- DeepSeek〔S · model_maker〕— V4 Pro 0813 被 HN、OpenRouter、SemiAnalysis、OpenCode Go 同时提到;价格 / agentic task 表现是扩散点。
- Meta Muse Glimmer〔A · model_maker〕— 30B open-weight multimodal model 在 HF trending;Simon Willison 强调 Apache 2.0 和本地视觉能力,llama.cpp 做 Day-0 GGUF 支持。
- Cohere North Micro Vision〔A · model_maker〕— 小型 VLM 走 Apache 2.0,主打文档理解和 visual Q&A。
Agent / Dev tools
- Cursor〔A · dev_tools〕— 支持 Agent Plugins,把 skills 和 MCP servers 作为跨 agent 扩展标准;同时继续强调 Router 降低延迟和成本。
- Boris Cherny / Claude Code〔S · dev_tools〕— Claude Code auto mode 默认开启,关键问题从“能不能执行”转向“如何判断命令安全”。
- Replit〔A · dev_tools〕— MCP beta 可创建、加载、搜索、发布 app;agent 从 IDE 能力扩到部署链路。
- Runway〔A · key_startup〕— Agent 接入 Figma / Dropbox / Notion,创意工作流也在补 connectors。
- Sierra〔A · key_startup〕— agent 开始处理真实世界里最脏的 IVR 电话菜单;Voice Personas 把“能做事”和“像品牌一样表达”拆开。
- Vercel〔A · dev_tools〕— AI SDK software factory 四周内贡献最多 35% merged PR、关闭 70% July issues,这是今天最具体的“agent 进生产”样本。
💰 投资 · Investor
- Sequoia〔S〕— Fireworks CEO Lin Qiao 的判断很准:prompting → RAG → post-training 的迁移点在 PMF 之后,因为那时产品表面才开始产生值得训练的数据。
- Sequoia〔S〕— 投 Preview,下注专业 AI video production;Sonya Huang 同步说 AI video 将带来下一年最大的 token tsunami。
- a16z〔S〕— “computer use leaderboard 不再是重度用户关心的故事”,投资层已经把关注点移到 agent 在真实任务里的可靠性。
- a16z〔S〕— Datadog CISO 讨论 4000+ 工程师使用 AI 后如何做 agent security,说明企业 agent 的下一道门槛是治理。
- Bessemer〔A〕— 发布 63 页 “Agentic Awakening” playbook,基于 20+ AI-pilled 工程团队,主题是组织如何被 agentic development 改造。
- Khosla Ventures〔A〕— 投 CormaAI defensive cybersecurity;同日 Sequoia 也投 Corma,AI cyber 是聪明钱共振。
🧠 解读 · Sense Maker
- AINews〔A〕— 把 Meta Muse Glimmer 定义为 open-weight frontier 回归:30B dense、Apache 2.0、量化到 20GB 以下、DFlash 加速,重点是“always-on local agents”。
- AINews〔A〕— frontier API vulnerability 暴露 hidden reasoning traces,含 API keys / passwords;这和 browser-agent hidden instruction 是同一类运营安全问题。
- TLDR AI〔A〕— 今日 headline 是 Cursor’s GitHub rival、OpenAI COO leaves、Gemini 1B milestone;和本报告主线一致:agent coding / 平台化高于单点聊天能力。
- Lenny Rachitsky〔S〕— “Claude Code for normal people” 把 skills、voice mode、协作方式讲给非工程人,这是 agent tooling 破圈的信号。
- a16z SPEEDRUN〔A〕— Peter Steinberger 讲 OpenClaw 式 agent army:保留 typos、管理多 agent、 hype 差点把系统压垮。对你这是近身样本。
- SemiAnalysis〔A〕— 祝贺 DeepSeek V4 Pro,并把矛头指向 Nemotron coalition 的组织问题;模型竞争不只是参数,也是数据、evals、委员会结构。
- 机器之心〔A〕— 116 页论文拆“蒸馏 Claude / GPT-5.6”与安全漏洞,中文侧今天最值得读的安全解释。
- 机器之心〔A〕— Libra 提升 Agentic RL 后训练吞吐,说明 agent training 的瓶颈开始从模型本身转到训练系统调度。
- Ethan Mollick〔A〕— 如果 LLM 只是在数学 / 科学里跨子领域组合想法,也已经足够革命;这是“AI as research collaborator”的认知层解释。
🔨 实践 · Practitioner
- Alex Finn〔A · builder〕— 测 Grok Bot 一周,评价它是目前本地 agent work / cloud agent work 结合最好的一种,也适合搭 multi-agent fleets。
- Greg Isenberg〔S · creator〕— 直播搭 marketing agents:监控 LinkedIn、抓互动人群、瀑布 enrich 到 email/phone,再跑 cold outreach。
- Greg Isenberg〔S〕— 继续推 Cloudflare agent pay-per-crawl 叙事:网站从内容页变成 agent customer 会付费访问的资源。
- DeepLearningAI〔A〕— 和 JetBrains 出 AI Coding Workflows: From Cloud to Local,主题是把默认模型、成本、数据外流变成可控选择。
- Jerry Liu〔A〕— ExtractBench 36 页白皮书:企业文档抽取最危险的失败不是错值,而是漏行还看起来没错。
- Simon Willison〔A〕— 本地跑 Muse Glimmer 30B 观察视觉能力,给“open weights + personal hardware”一手验证。
- Every〔A〕— 用 disposable “jigs” 调动画点、文字位置和 27 个变量;这是内容团队把 AI 产物做精细控制的好例子。
- filicroval〔A · probationary〕— 在单台 GX10 上做 Nemotron 3.5 Lightning specdec benchmark,完整协议、quality gates、bootstrap CIs;对“本地 agent 成本工程”有料。
🔥 专业热榜(by-feed·trending·专业)
- HN: Grok 4.6 与 Artificial Analysis benchmark 同时上榜,说明 Grok 不只是 Elon 刷屏,开发者榜也在看。
- HN: DeepSeek V4 Pro 0813 和 Qwen3.8-2.4T 同日出现,开放 / 低价模型竞争密度很高。
- HF: Kimi-K3、Meta Muse Glimmer 30B、LTX-2.5 都在榜,模型热点明显偏 multimodal / video / local。
- HF Paper: VibeLifeBench 问 personal assistant 能否 proactive and persistent;这正是个人 AI OS 的核心评测问题。
- HF Paper: Why Does CLAUDE.md Keep Growing? 把 agentic coding 里的“灾难性记忆”问题量化:追加 instruction 容易,删除和压缩才难。
- Product Hunt: Grok Bot、BearDrive、Cohesor 都是 agent control / shared context / teammate 方向。
- 掘金 上“Codex + Obsidian 自生长个人知识库”、Agent Skills 工程实践、AI 自动剪视频 skills 连续出现,中文开发者已经把 skills 当新工作流原语。
👥 我的 feeds(by-feed·mine)
- Jason Cohen 说 AI agents 运营一人公司之前,创始人必须把每个角色怎么做事写到极细,再长期管理和改进这些 agents。这句话很适合你的“超级个体飞轮”。
- Rohan Paul 转 Garry Tan:“Entire startups these days will be markdown files. Own your skills…” 这几乎是 OpenClaw / AGENTS.md 的商业表达。
- Peter Steinberger 在 a16z speedrun fireside 里强调:agent 时代要“manage an army”,还要保留人的判断和粗糙痕迹。
- Steve Messina 推荐 CLAUDE.md 增长论文:维护 AGENTS.md / CLAUDE.md 的人都该读,说明你的工作方式本身正在变成研究对象。
- Marcos Rico Peng 发布 Palmier:教 Claude 按你的风格剪视频,并把风格复用到每个视频;内容创作 workflow 又近了一步。
- Natasha Lee 提到新加坡 AI skepticism 全球最低但 desk workers 日用率只有 6%,这是你在 SG 华语市场讲“工具可得 ≠ 系统可用”的好切口。
🌶️ 热点(热点 pass · 国内市场脉搏)
今天 CN 平台原生抓取全暗,本段只采用 X 上追踪到的中文 creator 热点,不能代表小红书 / B站 / 抖音全量市场。
- 数字生命卡兹克 把 Grok 4.6、DeepSeek V4 Pro 0813、WeLM-617B、Qwen3.8-2.4T-A95B 称为“疯狂星期三”;随后用 DeepSeek V4 Pro 做网站部署、60 种 Bento 风格和 Three.js 游戏,再测 Grok 4.6,结论是 Grok 一次成功率可能更好,但价格 DeepSeek 赢。
- 歸藏 把 Grok 4.6 的价格和 Premium+ / Grok Build 授权串起来,同时跟 DeepSeek V4 Pro 与 OpenCode Go 可用性;国内 creator 关注点是“今天能不能白嫖 / 能不能直接跑”。
- 歸藏 还提到小红书 Read Skills Top 100,skills 排行榜本身是一个很有意思的中文平台信号:AI 能力开始被平台包装成可消费、可排行的“技能商品”。
- 数字生命卡兹克 说“新手用 AI,Token 比工资都高但产出不及格”,这比模型发布更贴近大众痛点:AI 驾校会比工具清单更有需求。
- 歸藏 提到 ChatGPT Linux 桌面版:AI 让开发者转向 Linux 的阻力变小,工具生态会继续向 power user 倾斜。