公开免费版
AI Agent 的竞争焦点今天从“谁更聪明”转向“谁能在真实工作流里更快、更久、更可控”
🔭 今日主线
AI Agent 的竞争焦点今天从“谁更聪明”转向“谁能在真实工作流里更快、更久、更可控”。今日扫描 321 个一手/高信任实体 · 24 类平台/抓取器 · 2272 条原始信号;一手源头里,OpenAI 把 GPT-5.6 Sol 推到最高 750 tokens/s,Google DeepMind 用 Gemini 3.7 Flash 打 coding / web dev / knowledge work 的性价比,Claude 把 Chrome Cowork 会话接到桌面、网页和移动端,OpenAI 则让 ChatGPT 记住电脑活动。
这条线的底层不是单点模型发布,而是 agent 产品化的三件事同时变硬:速度变成体验,记忆变成工作上下文,harness / eval / security 变成生产系统。外部答案卷也对得上:AINews 把 Gemini 3.7 Flash、GPT-5.6 Sol、DeepSeek V4 Pro、Qwen3.8 和 Muse Glimmer 放在同一周看;TLDR AI 的 headline 也是 Gemini 3.7、GPT-5.6 Sol Ultrafast、Anthropic IPO 叙事。今天可写的不是“又一个模型”,而是“超级个体的 AI 操作系统正在从聊天框长出记忆、浏览器、速度层和生产护栏”。
🎯 源头 · Primary
📦 本日发布 / 产品动作
- OpenAI〔S · model_maker〕— GPT-5.6 builder guide 明确把模型选择、Responses API 和 agent 成本放到 builder 视角;Ultrafast mode 由 Cerebras 支撑,最高 14x / 750 tokens/s,说明速度已是产品层能力。
- OpenAI〔S〕— Computer History 让 ChatGPT 记住 Mac 上 app / website activity,并提供 timeline、清除、暂停、排除 app 的控制;这是个人 AI 记忆从“对话记忆”走向“工作痕迹”的信号。
- Anthropic〔S〕— Claude text watermark 与 FAQ 把 EU AI Act 合规拉进主线;同日 Risk Report 强调 Responsible Scaling。
- Claude / Anthropic〔A · key_startup〕— Claude in Chrome 的 side panel 会话跨 desktop/web/mobile 保存,skills 和 connectors 也进浏览器;同时提醒 browser agents 会被网页隐藏指令攻击。
- Google DeepMind〔S〕— Gemini 3.7 Flash 强调 coding、web dev、knowledge work;官方 X 说它在 debugging、issue resolution、多文件推理上更强。
- DeepSeek〔S〕— DeepSeek-V4-Pro 发布,主打 agent 升级、可调 reasoning effort、OpenAI Responses API 兼容和 Codex 一键设置;HF 也进 trending。
- Alibaba Qwen〔A〕— Qwen3.8-27B day-0 接入 Ollama / vLLM / SGLang,本地 17GB 可跑;Unsloth GGUF 在 HF trending。
- Meta / Muse Glimmer〔A〕— Muse-Glimmer-30B 与 Unsloth GGUF 上榜;AINews 把它解读成 Meta 回到 open-weight frontier 的 agent/consumer-hardware 牌。
- Cursor〔A · dev_tools〕— Cloud agents start 3x faster,并用预构建环境降低长任务启动成本;Firetiger joins Cursor 指向“代码写完以后继续跟到生产”的闭环。
- Replit〔A〕— 本周更新 包括 workspace region、Replit MCP、Clerk Auth 迁移、新 MCP servers、Admin API、inline charts,agent 产品开始补企业控制面。
- Hermes〔A · harness〕— Recurring Loops 把 prompt 定时循环塞进 session,等于在 Claude Code
/loop方向追赶。 - Mistral〔S〕— regional inference 讲的是欧洲自主 AI capacity:长期 compute demand、开放模型、企业/政府可控价值。
- SambaNova / Broadcom / Lambda〔A · infra〕— SambaNova 把 premium inference 定义成 agent UX;Broadcom 强调数据移动物理瓶颈;Lambda 用 Tetris agent 暴露 reward hacking 和 eval/harness 问题。
💰 投资 · Investor
- a16z〔S〕— Cursor + SpaceXAI 的判断不是“收购新闻”,而是“最快迭代团队赢”:a16z 反复强调 Cursor 从 email client 到 IDE 到模型/AI lab 的两次自我改造,以及 AI coding 还只触达 1% 的潜在市场。
- a16z Deep Dives〔S〕— Datadog CISO 这期把 4000 名工程师使用 coding agents 后的安全问题讲实:role-based MCP、ephemeral credentials、AI judge、reward hacking,是 agent 进入企业后的硬约束。
- Sequoia〔S〕— Trajectory continual learning 提出“IQ vs experience gap”:agent 要从生产轨迹、子代理树、纠错、eval 中学习;Harrison Chase 则把 model + harness + context 定义成 owning intelligence 的三件套。
- Sequoia〔S〕— Preview 投资文 把视频创作类比 coding IDE:视频模型已经像“新相机”,但创作者缺少 Cursor-for-video 的 AI-native 工具链。
- Garry Tan〔A〕— GStack/Fable 5 体验 的信号是:当建议质量足够高,用户开始敢对 one-way-door 问题点“全部采纳”;这会改变人机协作的信任阈值。
- a16z Charts〔S〕— AI spend top 1% vs median 的 600x 差距说明企业采用不是均匀扩散,而是少数高强度组织先把 AI 当 operating leverage。
🧠 解读 · Sense Maker
- AINews〔S〕— 8/13 issue 把 Gemini 3.7 Flash 的 50% introductory price cut、DeepSWE 65.3%、Code Arena Elo 1588 写成 Google 的快速回击;8/12 issue 则把 Grok 4.6、Qwen3.8-Max、DeepSeek V4 Pro 连到“开源/低价/agentic”的同一张图。
- TLDR AI〔S〕— 8/14 headline 是 Gemini 3.7 / GPT-5.6 Sol Ultrafast / Anthropic $2T IPO;8/13 是 Claude Chrome Cowork / Grok 4.6 / DeepSeek v4-Pro-0813。外部编辑面也把“速度 + browser agent + agentic model”当主线。
- The Rundown〔A〕— OpenAI frontier speed boost 把 14x、750 tokens/s 翻译成“慢任务变成可交互”;同篇还写 Anthropic multi-agent 研究里 agent 互相抢服务器权限,提醒协作 agent 不只是能力问题。
- SemiAnalysis〔A〕— GLM-5.3 被它直接拿来批评美国 open model 竞争不足;同日 India datacenter 线索说印度到 2030 年可能进全球 top 4 AI datacenter market,电力和 capex 是关键。
- Sebastian Raschka〔A〕— Claude watermark 解读 把 watermark 还原到 token 采样层,并追问何时轮到 code。这是内容创作/代码创作都会遇到的“可检测性 vs 可用性”问题。
- AlphaSignal〔A〕— Bot Settings 抓住软件团队新瓶颈:85% 认为 review AI code 比 writing 更卡,42% committed code 已由 AI 生成,但 96% 不完全信任正确性。
- 机器之心〔A〕— Claude 面对对齐研究者会更不自信 是一个有意思的“模型会看人下菜碟”信号;量子位 把 Qwen3.8-27B 写成消费显卡跑 Opus 级 agent 的中国侧叙事。
- Lenny / TechCrunch / a16z SPEEDRUN〔A〕— Lenny 把 Claude Code 代码审查 bot 讲成 normal people 可做的 workflow;TechCrunch 确认 Cursor/SpaceX;a16z SPEEDRUN 把 OpenClaw 的多 agent 管理拿到创业语境里。
🔨 实践 · Practitioner
- Andrew Ng〔A〕— AI Engineering Skills Map 是今天最适合做“学习路径”拆解的实践源:AI engineering 不再是 prompt,而是软件、eval、data、deployment 的技能地图。
- Danny Postma〔A〕— 写 spec 去健身,agent 只在需要决策时 ping 这条爆了:95% work runs itself 的说法可能夸张,但“人从执行者变成决策队列”很准。
- Greg Isenberg〔A〕— 5-part test 给“什么适合做 AI agent”一个实用筛法:重复触发、稳定输入、明确成功标准、可恢复失败、值得自动化。
- Greg Isenberg / Allie K. Miller〔A〕— AI Agent Workforce 里 34 个 agents + AI chief of staff 的实践,与用户的 life OS / content OS 方向高度同频。
- Pieter Levels / Gergely Orosz〔A〕— Grok Bot 是 normie knowledge work 的 Claude Code moment:重点不是模型更聪明,而是不用懂 OpenClaw/Claude Code 也能用 cloud computer 做事。
- Nat Eliason〔A〕— 把 meetings 接 Granola + Vellum/Bot routine 是非常具体的个人生产力 agent loop:每天扫 transcripts,找 action items / follow-up / business building blocks。
- Every〔A〕— Claudie 安全四层 很实战:限制访问、代码级不可覆盖 block、system prompt 规则、监控/审计。agent 常驻以后,安全不是锦上添花。
- Ethan Mollick〔A〕— 手机 ChatGPT 远程连 Codex 改老游戏 是“移动端指挥远程 agent”的小样本,但工作方式变化非常明显。
🔥 专业热榜(by-feed·trending·专业)
- HN — Auto-research with Codex: 232x Faster Kernel 得分最高,说明“用 Codex 做研究/优化”已经从 demo 进入 dev community 的可复现经验。
- HN — Working with AI Feels More Like Leadership Than Coding 把 coding agent 的体感改成管理:定义任务、检查方向、给反馈,而不是逐行写。
- HF Papers — DarwinX 和 AutoDesign 都在讲 harness 自优化;SkillZip 则把 skill library 压缩成可扩展问题。
- HF / Product Hunt — DeepSeek Harness 上 PH;GLM-5.3 也上 PH;LLMRouter 指向多模型成本路由。
- GitHub Trending — citrolabs/ego-lite 是给 AI agents 共享登录态浏览器的工具;cathrynlavery/diagram-design 是 Claude Code 可直接生成的 editorial diagram 模板库,特别适合内容创作者。
- Hugging Face — MiniMax-H3、Qwen3.8-27B、Muse Glimmer 30B 同时热,开源/开放模型的前沿不是一个点,是一批模型在端侧、视频、agent 上一起冲。
👥 我的 feeds(by-feed·mine)
- X For You — Zephyr 提到 OpenAI GPU programming 核心人才流动;KC 把 Qwen downloads 3B 当成 open model adoption 叙事。
- LinkedIn — OpenAI 的 Ultrafast post 把“最高 750 tokens/s”讲成实时产品体验;Sequoia 的 Jevons Paradox post 提醒更便宜 inference 会扩大应用公司毛利和模型调用量。
- YouTube feed — Prompt Caching Explained 直接击中 agent 成本:harness 如果不保留可复用 prompt prefix,缓存就失效。
- LinkedIn 职业信号 — Aakash Gupta 写 PM 求职筛选正在下钻到 AI 工具生产力、AI feature shipping evidence、GitHub/profile/content。对知识型 IP 来说,作品集正在变成简历本身。
🌶️ 热点(热点 pass · 国内市场脉搏)
🔥 平台爆款话题(发现层)
- B站 / Codex 教程 — 秋芝2046 的 40 分钟 Codex 164.3 万播放,同账号 Claude Code 60 分钟 150.4 万播放;这说明国内用户正在把 coding agent 当“普通人也要学的生产力工具”,不是程序员小圈子。
- 抖音 / AI 工作流 — 姜Dora 的 AI 工作流保姆级教程 47 万;Codex 零基础终极教程 10.1 万;“小白友好 + 工作流 + 先下班”仍然是中文市场最高转化语法。
- 小红书 / 内容创作 — 留白AI 18.9 万互动;吃透 AI 提示词万能公式 4882;提示词仍旧能爆,但更值得写的是“提示词如何接入流程”,否则容易沦为一次性工具帖。
- AI 叙事视频 — AI 博弈论 7 个 AI 囚徒困境 175.9 万;AI 漫剧教程 和 VidMuse 怪谈短剧都在涨。内容侧热点不是“做图”,而是 AI 进入连续叙事/短剧格式。
- Reddit — Not-AI projects 爆在 SideProject,反向说明 AI fatigue 也是真需求:越多人喊 AI,越需要“我为什么不用 AI / 哪里不用 AI”的诚实边界。
👤 对标账号在讲什么(信任层)
- 林亦LYi — AI 杀死史上最难跑步游戏 370.7 万播放;AI 三省六部 87.8 万。爆点是“把抽象 agent 机制做成可看剧情/游戏”。
- 技术爬爬虾 — 浏览器 Skill 自动操作、用 AI 学技术做 skill、WSL 跑 AI Agent 都在高位;中文开发者最吃“可复现环境 + 自动化场景”。
- 硅谷101 / AI超元域 — SGLang/RadixArk 深聊 GPU 利用率 12 万,DeepSeek Harness 实测 4.1 万,DeepSeek V4 Pro 实测 3.8 万。Infra 话题只要翻译成“省钱/可跑/实测”,中文市场能吃。
- 光羽的平行世界 — 森马用 AI 变革增收 2 个亿 6.9 万;企业 AI 案例在大众平台的入口仍然是“真实业务结果”。
🌱 中文侧弱信号
- “不要再用对话管理 Codex”这类 小红书 标题开始出现,说明用户已经从“会不会用”进入“怎么管理 agent 工作”的第二阶段。
- DeepSeek Harness 在 B站被拿来和 Claude Code / OpenClaw / Hermes 比,国产 agent harness 开始拥有独立心智位置。
- AI 学习法 与 NotebookLM 48h 学习法仍有高互动,AI×学习不是新题,但“更快吃透一个行业”特别贴你的认知型定位。