AI情报
中文版
公开免费版

今天的主线是:agent 产品开始从“会执行任务”转向“必须有标准、记忆、评估和权限边界”。News 侧看到的是模型公司、云入口、企业评估和安全框架一起补课

🔭 今日主线

今天的主线是:agent 产品开始从“会执行任务”转向“必须有标准、记忆、评估和权限边界”。News 侧看到的是模型公司、云入口、企业评估和安全框架一起补课;Viral 侧看到的是豆包手机助手、WorkBuddy、Windows-MCP、WebMCP、Pi Agent、DeepSeek Harness 把抽象能力压成普通用户能看懂的工作流结果。

今日两份报告合计覆盖 1995 条原始内容:News 扫描 1147 条、候选 549 条;Viral 扫描 848 条、候选 646 条。重复信号集中在 Grok 4.7、Step 5 Preview、Jev、Kimi Browser Extension、Qwen/国产模型、agent harness 与浏览器/手机入口;合并后保留一次事实,分别放在 News 的技术/产业链条和 Viral 的传播/爆款链条中解读。

OpenAI 把下一阶段 AI 标准推到台前,Anthropic 用 Accenture 嵌入评估和生命科学验证计划证明企业采纳需要第三方验证,DeepLearningAI 把 Meta Muse 的安全方案讲成 OS 层隔离而不是模型自律。与此同时,B站豆包 Agent 教程抖音 WorkBuddy 教程Windows-MCPWebMCP 的爆发说明,普通用户不再为“模型更强”买单,而是为“它能替我完成一个真实流程”转发、收藏和评论。

对内容创业者来说,今天最值得写的不是“哪个模型更强”,而是“当 AI 从回答问题走向代替你操作世界,个人创作者需要怎样的标准、记忆、权限和可复现工作流”。

🎯 源头 · Primary

📦 本日发布

  • OpenAI:设立数学与 AI 顾问组,说明前沿模型成果需要学术标准与外部判断共同背书。
  • OpenAI:Higgsfield 用 GPT-6 Astra 一天内上线视频广告功能,给内容工具公司提供“从 prompt 到生产”的案例。
  • OpenAI:呼吁下一阶段 AI 标准,重点从模型能力转向评估、报告和治理。
  • Anthropic:与 Accenture 做嵌入式评估,企业购买模型时会越来越看第三方验证能力。
  • Anthropic:开放生命科学验证计划,高风险行业的 AI 准入正在变成产品能力。
  • DeepSeek:DeepSeek-V4.1-Flash 登上 Hugging Face 热榜,开源模型的分发优势继续存在。
  • Moonshot AI / Kimi:Kimi K3 登陆 Amazon Bedrock,国产模型开始进入带加密、审计和企业控制的云入口。
  • Moonshot AI / Kimi:Kimi Browser Extension 把侧边栏聊天、网页导航和填表连起来,浏览器会成为个人 agent 的重要战场。
  • 阶跃星辰 StepFun:Step 5 Preview 强调 agentic work 和软件工程能力,国产旗舰模型也在用任务成本和长上下文讲故事。
  • Alibaba Qwen:Qwen-Image-2.1 获得 OpenVINO day-0 支持,视觉模型的本地优化会扩大创作者可用半径。
  • MiniMax:MiniMax Code CLI 开放,中文 coding agent 栈继续从模型发布走向可用工具。
  • ElevenLabs:Scribe v2 Medical 针对临床语音降低错误率,垂直场景会比通用语音更早形成付费理由。
  • Runway:推出 DIFFUSE 连接品牌与 AI-native 创意人才,生成式视频正在从工具变成供需市场。
  • Perplexity:Perplexity Computer 接入 MiniMax H3 和 Seedance 2.5,搜索/浏览入口正在吞下创意生产任务。
  • Mistral AI:与 Mozilla 合作浏览器 AI,隐私和可控性会成为浏览器 agent 的差异化卖点。
  • OpenClaw:本地 agent 操作系统继续出现在核心源里,仍是值得长期跟踪的自研栈方向。

模型、浏览器与评估边界

  • OpenAI:让独立数学家参与 AI 数学成果评估和传播,前沿能力越强,越需要可信解释机制。
  • OpenAI / Figma:Figma 把 GPT-6 Astra 用在飞行控制体验设计,关键不是生成界面,而是理解复杂系统约束。
  • OpenAI / Ramp:Ramp 用一句需求让 Astra 构建并自测 API key 路由功能,这是 agent 从“写代码”走向“完成任务”的样板。
  • OpenAI:公布模型失准追踪与披露框架,公开信任会越来越依赖事后调查和时间线。
  • Anthropic:与 Accenture 至少投入 10 亿美元建设前沿评估能力,安全评估正在变成产业级岗位。
  • Anthropic:提出衡量 AI 参与 AI 研发的三项指标,recursive AI R&D 已需要公共量尺。
  • Anthropic:生命科学验证计划把 Mythos 放进受控场景,模型公司正在用“准入制度”换更深行业信任。
  • Sam Altman:强调实验室外的人也该参与 AI 标准制定,治理叙事会影响前沿模型的公共合法性。
  • Sam Altman:预告原计划本周发布的重点内容推迟,提醒跟踪模型公司时要区分 hype 和真实交付节奏。
  • Demis Hassabis:DeepMind Institute 扩展跨学科研究,AGI 影响经济、科学和社会的讨论正在机构化。
  • Boris Cherny:Claude Projects 改变他写代码的方式,项目级上下文正在替代一次性 session 管理。
  • Boris Cherny:Claude Docs、Slides 和 Design 进入每个对话,Anthropic 正把 Claude 从聊天工具推进工作套件。
  • Fireworks AI:在 113 个真实 coding 任务上做模型路由,多模型时代关键能力是为任务选对模型。
  • CoreWeave:强调生产级 agent 需要在线评估、离线基准和基础设施,补上“能跑不等于能用”的判断。
  • NVIDIA:为 Grok 4.7 背书其 coding 与知识工作能力,算力平台继续用模型发布强化生态位置。
  • Vercel:对 Grok 4.7 给出 AI Gateway 折扣,模型分发和开发入口正在用价格抢工作流。
  • Hugging Face:展示个人预测天气的模型工作流,开源平台正在把模型使用变成普通人的可操作任务。

💰 投资 · Investor

  • Garry Tan:称 Capy 能更快追踪多步 workflow 并做大 PR,coding agent 的竞争点落到速度、成本和任务连续性。
  • Garry Tan:认为 Cluely 这类实时思考助手仍是好方向,半对抗式上下文陪跑可能成为个人生产力形态。
  • Garry Tan:Capy 在 DeepSWE 上更快更便宜,说明投资人正在盯 coding harness 的可量化胜率。
  • Garry Tan:承认数据中心恐慌虽荒唐但会影响结果,算力叙事仍会驱动资本和政策。
  • Garry Tan:消费者互联网公司急着应对 AI 中介化,Google 之后的新入口焦虑已经开始。
  • a16z:Horowitz Andreessen Academy 把 AI 时代教育定义为“能做任何事”,课程会围绕难到必须用 AI 的任务设计。
  • a16z:学院孵化文章把“无限执行力时代”作为前提,投资机构也在重写教育产品的价值主张。
  • a16z:用 SaaS 股票反弹反驳 SaaSpocalypse,提醒不要把“AI 会替代软件”讲成线性结论。
  • a16z:图表周报把应用爆炸、创业成本和软件反弹放在一起,机会变多也意味着注意力更稀缺。
  • Sequoia Capital:Databricks CEO 的长期成长故事说明 AI 创业仍需要组织能力,而不是只靠一次技术窗口。
  • Sequoia Capital:Aaron Levie 谈 Box 在 AI 时代重塑自己,传统 SaaS 的机会在于把模型接进既有业务资产。
  • Y Combinator:Confido 把消费品牌后台变成 AI workforce,垂直 agent 正从财务、销售和需求计划切入。
  • Y Combinator:银行可信 agent 案例说明垂直行业卖点不是“聪明”,而是合规与可依赖。
  • Y Combinator:Cua-Bench-S1 把 computer use 决策模型做成基准,Jev 这类低成本决策层需要自己的评测体系。
  • Sarah Guo:指出用户会越来越讨厌公司刻意限制 tokens 和 inference,这对产品定价和体验都是警告。
  • Sonya Huang:判断软件构建成本趋近零会带来品类重组,内容产品也要警惕工具被平台吞并。
  • Khosla Ventures:认为个人 AI agent 不会 winner-take-all,入口会分散在邮件、短信和日常工作流里。
  • Khosla Ventures:FactoryAI 融资被视为自治、自我改进软件的里程碑,软件生产系统仍是聪明钱押注点。
  • Lightspeed:Pocket FM 系列收入超过 9000 万美元,AI 内容机会最终仍要落到 IP、分发和付费。

🧠 解读 · Sense Maker

  • Naval Ravikant:认为未来更可能是 AI 代表人类彼此博弈,这句话适合解释 agent 的委托与责任边界。
  • Naval Ravikant:转发吴恩达对 AI 恐慌的反驳,高信任解读源正在共同压低末日叙事。
  • Naval Ravikant:用火与核武风险类比提醒读者,AI 治理分歧本质上是扩散还是管制的选择。
  • The Rundown AI:Amazon 阻断 Meta Muse 购物访问,说明浏览器 agent 的身份披露和权限边界已经进入商业冲突。
  • The Rundown AI:美国“AI Force”叙事把 AI 安全与国家竞争绑在一起,公共讨论会更政治化。
  • SemiAnalysis:观察华为 Ascend 推理引擎进展,国产硬件生态的工程韧性值得持续看。
  • SemiAnalysis:讨论 Intel EMIB 是否分流 CoWoS,AI 基础设施瓶颈仍在先进封装和供给链。
  • SemiAnalysis:分析数据中心 moratorium 风险,算力扩张不只取决于芯片,也取决于许可、用电和地方政治。
  • SemiAnalysis:Engram offload 到 DRAM 最高提升 50% 推理性能,应用层成本最终仍被底层推理优化决定。
  • TLDR AI:把 Opus 5.5、Grok 4.7 和 MiMo v2.6 放在同一天答案卷里,外部编辑也在关注模型迭代与国产开源。
  • a16z SPEEDRUN:Rillet CEO 的 wedge 叙事提醒一人公司也要先找到清晰切口,而不是一上来做全系统。
  • 机器之心:openJiuwen 被称为 Agent 版 Hugging Face,开源智能体资产平台是中文生态值得跟踪的新基础设施。
  • 机器之心:报道模型和智能体新动向,中文读者仍需要可解释的一手转译层。
  • Rohan Paul:引用 Cerebras CEO 对硅谷 AI 强度的描述,现在的产业氛围已接近全员冲刺。

🔨 实践 · Practitioner

  • Alex Finn:把 Grok 4.7 视为 Grok Bot 的 agentic 模型,普通用户会通过具体 harness 感知模型升级。
  • Alex Finn:用视频展示 Grok 4.7 工作流,传播点不是 benchmark,而是“十倍知识工作”的可见 demo。
  • Alex Finn:认为 AI agent race 比模型 race 更大,因为入口掌握个人数据、交易和信息流。
  • Andrew Ng:认为近期 AI 危险恐慌更多是 PR 推动而非技术突变,适合做“安全要工程化讨论”的内容。
  • DeepLearningAI:一万 agent 形式化 Navier-Stokes 的争议说明,规模化智能体实验需要人类评价和上下文解释。
  • DeepLearningAI:Meta Muse 的 prompt injection 防御放在 OS 层,真正的 agent 安全不会只靠模型“学乖”。
  • 宝玉xp:转译吴恩达观点,把“OpenAI agent 逃出沙盒”拆回工程问题,中文读者需要这种去恐慌化解释。
  • 课代表立正:用“赚钱机会被自己分析没了”讲注意力和行动,AI 工具之外,行动阻力仍是创作者现实瓶颈。
  • 课代表立正:提醒不要只问 AI 能不能做,而要问怎么用好它,落到实践者工作流视角。
  • filicroval:把 MiMo-V2.6-Flash 描述为少见的自我改进模型卡,国产模型的技术叙事正在更清楚。
  • Ethan Mollick:把 Meta Muse 看成个人助理 agent 的可用实现,可访问性可能比炫技更影响大众采用。
  • Every:展示 Codex 接 Notion、Slack 和本地文件的 SOP,个人 AI 工作系统正在变成可复制范式。
  • Pieter Levels:判断在非 AI 业务里应用 AI 比再做 AI 产品更有竞争力,贴合一人公司定位。
  • Jerry Liu:认为 Jev 的价值在于把轻量业务判断交给更便宜的系统一层,重智能留给大 agent。

🔥 专业热榜(by-feed·trending·专业)

👥 我的 feeds(by-feed·mine)

🌶️ 热点(热点 pass · 国内市场脉搏)

🔥 平台爆款话题

👤 对标账号在讲什么

  • 课代表立正:赚钱机会被自己分析没了,提醒 AI 工具之外,行动阻力仍是现实瓶颈。
  • 课代表立正:问题从“AI 能不能做”转向“我怎么用好它”。
  • 宝玉xp:中文长帖转译吴恩达反 AI 恐慌观点,信任创作者承担公共解释层角色。
  • 数字生命卡兹克:用上 Codex 跨 session 对话,个人多项目 agent 协作开始成为真实工作流。
  • 歸藏:判断 Jev 爆火靠速度和数量带来的原始刺激,demo 密度是新模型传播关键。

🌱 中文侧弱信号

🔭 今日主线

Agent 热点今天从“工具名竞争”转向“可见的工作流结果”:豆包手机助手、WorkBuddy、Windows-MCP、WebMCP、Pi Agent、DeepSeek Harness 都在用教程、实测和演示把抽象能力压成一个能被普通创作者看懂的动作。

小红书今天缺席,所以中文收藏型内容的判断被削薄;但 B站和抖音给出的信号仍然清楚:爆款不是“新模型发布”,而是“AI 能否替一个人完成一段真实流程”。

🔥 热点话题

领域热点

  • 抖音 · WorkBuddy 工作流教程 —— 热度 8203 万赞、同平台 pct100;WorkBuddy 被拍成“手把手搭工作流”,大众侧最吃的是 agent 能不能立刻变成可跟练流程。
  • B站 · 豆包 Agent 入门教程 —— 热度 105.7 万播放、同平台 pct100;豆包从聊天工具变成“能干活”的手机/agent 入口。
  • 抖音 · Windows-MCP 开源 —— 热度 100 万赞、同平台 pct99;“AI 直接操作 Windows 元素”把 MCP 从开发者协议变成普通人能想象的电脑自动化场景。
  • 抖音 · WebMCP 保姆级教程 —— 热度 120 万赞、同平台 pct100;网站被 AI Agent 调用的概念落到买设备、查机票、Shopify 插件,就从技术协议变成产品入口变化。
  • B站 · Pi 极简 Agent 全攻略 —— 热度 82.1 万播放、同平台 pct99;AI 编程工具进入“横向选型地图”阶段。
  • B站 · Cherry Studio V2 真实场景分享 —— 热度 54.6 万播放、同平台 pct98;桌面 AI 客户端的传播点不再是接多少模型,而是能否给出真实场景组合方案。
  • B站 · DeepSeek Harness 实测 —— 热度 7.4 万播放、同平台 pct93;国产模型生态开始补工作台、插件、多模型接入和执行轨迹。
  • 抖音 · WeClone 数字分身 —— 热度 67 万赞、同平台 pct99;“用聊天记录训练自己”把 AI 克隆从视觉形象推进到关系和语气。
  • Reddit · Not-AI 项目征集 —— 热度 1796 评论、同平台 pct100;英文 indie 圈对 AI 标签出现疲劳,反而让“非 AI 但真实解决问题”的项目获得注意力。
  • Reddit · Qwen 4 发布讨论 —— 热度 1696 综合互动、459 评论、同平台 pct97;开源模型社区继续把 Qwen 当成中美模型竞争的关键观察点。
  • X · Grok 4.7 + Grok Build —— 热度 84.2 万综合互动、同平台 pct98;Grok 被包装成日常构建工作马。
  • X · Alibaba Apsara Conference —— 热度 47.5 万综合互动、同平台 pct95;“Machine Thinking 不到人类能力 3%”被阿里用来承接下一阶段云和 AI 基建想象。

泛热点

👥 平台流

投资 / 教育化信号

英文算法流

中文平台候选分布

  • B站 —— 343 条热点候选;承担豆包手机助手、Agent 教程、工具评测、AI 基建深解释,适合观察“长教程如何爆”。
  • 抖音 —— 230 条热点候选;强在 WorkBuddy、WebMCP、Windows-MCP、AI 视频叙事和大众化教程,适合观察第一秒钩子。
  • Reddit —— 39 条热点候选;提供反向市场温度,包括 Not-AI、Qwen 4、开源模型和买家稀缺。
  • X / Twitter —— 87 条专业候选;集中在 Grok Build、a16z Academy、阿里云、OpenMuse 和 AI 教育化叙事。
  • LinkedIn —— 12 条专业候选;量不大,主要作为英文专业圈补充。

这是完整的公开版。想要每天的「选题建议」,或一份为你定位定制的雷达?

看订阅方式 →