30 秒速读
- GPT-5.6 把智能体的成本和编排能力一起下放
- Gemini 3.7 Flash 面向编程与智能体降价一半
- DeepSeek-V4-Pro 已同步进入 API,工具任务成绩很强
本日报从公开来源中筛选与独立开发者相关的模型、产品、需求和工作流变化。事实链接用于核对,价值判断是编辑分析。
今天最该知道的 10 条
GPT-5.6 把智能体的成本和编排能力一起下放 原文
- 具体:GPT-5.6 增加推理持久化、原生多智能体编排和程序化工具调用。官方案例中,Sol 启用保留推理与压缩后,ARC-AGI-3 从 13.3% 到 38.3%,输出 token 约少六倍;Luna 的 BrowseComp 成本从 33.27 美元降到 1.33 美元。
- 价值:别把它只当新模型。现在可卖的是“把长任务跑得更便宜、更可解释”的控制层:路由、缓存、失败重试和单次任务成本上限。 先把同一任务的前后两次运行排在一起,用户才能判断优化来自模型、提示词还是工具链。
Gemini 3.7 Flash 面向编程与智能体降价一半 原文
- 具体:Google DeepMind 在 3.6 Flash 发布三周后推出 3.7 Flash,定位编程和智能体任务;输入每百万 token 0.75 美元、输出 3.75 美元,均为 3.6 Flash 的一半。
- 价值:低价工作模型会压缩通用代码助手的空间,但会扩大批处理、持续维护和小团队自动化的可行任务量。先用真实仓库任务做同成本对比。 测试时记录首次成功率和返工时间,不能只看单轮 benchmark 或每百万 token 的标价。
DeepSeek-V4-Pro 已同步进入 API,工具任务成绩很强 原文
- 具体:deepseek-v4-pro 已在 App、网页和 API 上线。更新页给出的 HLE 无工具/有工具成绩为 42.7/60.0,Terminal Bench 2.1 为 87.9。
- 价值:值得测试的不是聊天回答,而是终端、浏览器和多步工具调用。中文团队可拿一个固定流程测成功率、人工接管点和总成本,再决定是否替换主力模型。 固定输入、固定权限、固定验收条件,才能让不同模型的结果可以比较。
Claude 日常维护已跑出 388 个 PR,但人工门控仍在 原文
- 具体:Boris Cherny 用 Slack 例程让 Claude 做崩溃模糊测试、重复代码统一和死代码清理,数周开出 388 个 PR;180 个经 Claude Code Review 与人工审核后合并。
- 价值:机会不在“再做一个写代码 agent”,而在把低风险维护任务变成可审阅队列:限定目录、验收测试、风险标签和可一键撤回的变更包。 第一版甚至只做依赖升级或死代码清理,也比承诺全自动修复生产故障可信。
Cursor builds 让云端编码 agent 不必每次冷启动 原文
- 具体:Cursor 为后台环境保存最近一次成功 build;环境启动快十倍、首个 token 快三倍,依赖安装失败也不会拖垮可运行的旧环境,并将默认启用。
- 价值:长任务体验的瓶颈常常不是模型,而是环境准备和失败恢复。可做给特定技术栈的“可复用干净工作区”,例如 WordPress 插件、数据管道或 Shopify 应用。 用户购买的是少等十分钟和少一次环境报错,而不是抽象的 agent 平台。
DeepSeek Harness 以插件化方式开放 agent 运行时 原文
- 具体:DeepSeek Harness v0.1 为 MIT 开源开发者预览;模型、工具、技能、会话、沙箱、文件系统、循环、编排和 UI 都可替换与组合。
- 价值:底座越来越多,独立开发者不该竞争通用框架。更好的切口是某个行业的可靠插件包:统一授权、审计记录、异常恢复和交付模板。 例如把某个 CRM 的检索、写回、审批和失败重试封成一个可按月收费的任务包。
Google Sheets canvas 把表格直接变成可交互小应用 原文
- 具体:Sheets canvas 让用户用自然语言把表格变成仪表盘、学习追踪器、座位表等交互式迷你应用,底层使用 Gemini。
- 价值:客户真正拥有的数据仍在表格里。不要从零抢通用 BI,挑一个表格密集场景,把字段校验、提醒、审批和外部动作做成更可靠的垂直界面。 先从“每天都要打开的一张表”切入,需求和首批测试用户都会比泛工具清楚。
Qwen3.8 开源并在首日提供 API,长链 agent 选项增多 原文
- 具体:Qwen3.8-2.4T-A95B 为开放权重模型,95B 激活参数,主打自主编码、深度研究和端到端 agent;硅基流动首日上线,缓存输入为每百万 token 0.25 美元。
- 价值:模型供给已足够拥挤。对产品而言,更有价值的是跨模型评测与切换:同一任务按质量、延迟、缓存命中和失败类型给出推荐。 这类结果也能沉淀为团队的模型采购记录,避免每个人凭印象切换供应商。
MAGI-2 Preview Open Weights 昨日榜外,今天进入视频榜第六 原文
- 具体:Artificial Analysis 的图生视频榜显示,MAGI-2 Preview Open Weights 当前第 6、Elo 1107,昨日不在榜内;本次被标为 watch,而不是已经稳定领先。
- 价值:先别据此改生产模型,但可以为视频工作流留一个可插拔候选位。连续三到七天测试角色一致性、可控性、速度和单位成片成本。 如果某一类素材稳定受益,再把推荐写进模板;不要把单日排行榜变成对客户的性能承诺。
AI agent 开始需要“能看懂的交付物”,不是一段完成提示 原文
- 具体:Product Hunt 上的 Media Sharing 让 agent 把截图和视频放进 PR;同日的 Qencode MCP 则让 agent 转码和处理视频。两者都把 agent 的结果接到已有协作流程里。
- 价值:真实用户不缺“执行了”的通知,缺的是可验收证据。围绕某一种工作,把前后对比、运行日志、产物预览和人工确认做成标准交付页更容易收费。 这也会降低负责人转发给同事、客户或审阅人的沟通成本,是比纯自动化更直接的付费理由。
大模型榜单异动
MAGI-2 Preview Open Weights 进入图生视频 Top10 原文
- 变化:当前第 6,Elo 1107;昨日榜外,属于新进 Top10 的 watch 级信号。当天没有 major_surge 级别的模型异动,其余 29 项均为小幅变化。
- 判断:它值得放进测试名单,不足以直接替换线上方案。若连续多日稳定,再按目标风格、失败率和每条视频成本评估;视频生产工具可用此作为“自动推荐备选”的素材。
值得注意的新产品、新方向、新模型
模型工作量正在从人工挑选变成运行时调度
- 具体:GPT-5.6 给出推理压缩与多智能体编排,Gemini 3.7 Flash 明确降价,Qwen 与 DeepSeek 又扩充了 agent 可选模型。供给变化集中在质量、价格和工具调用,而不是单纯聊天能力。
- 价值:能跨多个模型记录任务成功、成本和人工返工的小工具,会比再包装一个聊天框更接近付费动作。
可审阅的 agent 交付正在成为产品层标配
- 具体:Claude 的 388 个 PR 仍需自动 review 和人工审核;Media Sharing 把截图与视频交给 PR;Cursor 则保存已成功的环境,避免执行过程无法复现。
- 价值:面向团队的机会是“交付包”,不是黑箱自主性:每次运行要有范围、证据、测试、差异和撤回入口。
从表格到应用、从模型到垂直工作流的门槛继续下降
- 具体:Sheets canvas 证明非技术用户可以从结构化表格生成交互界面;holaOS、Harness 等项目持续把连接器、记忆和工具调用模块化。
- 价值:最好选一个已有表格和重复流程的行业,把人每天复制粘贴的两三个动作固定下来,再用 agent 处理例外。
未被满足的需求
小团队不知道一项 agent 任务究竟贵在哪里、错在哪里
- 信号:GPT-5.6 把成本从 33.27 美元降到 1.33 美元的案例,Gemini 3.7 Flash 的价格减半,都说明模型选择和推理策略直接改变单次交付成本。用户需要的是按任务拆开的 token、缓存、工具失败与人工返工账单。
自动化维护可以做,但负责人难以安全地放手
- 信号:Claude 388 个 PR 只有 180 个合并,AutoGPT 的维护经验还要依赖 PR 模板、测试计划、CI 门槛和人工审核。小团队缺少的是低风险任务白名单、变更审阅和可恢复的执行记录。
业务人员的表格流程缺少可控的“最后一公里”
- 信号:Sheets canvas 可以生成仪表盘和小应用,但采购跟进、客户回访、排班和审批仍有字段错误、权限和通知等实际约束。需求是把一个具体表格流程做成带校验、提醒和人工确认的轻量应用。
如果今天只有两个小时
做“Agent 任务体检单”的最小版本:只接一段 coding agent 或研究 agent 的运行日志,输出模型调用、token、工具失败、重试次数和人工接管位置,并给出一个明确的省钱或降风险建议。第一批用户去 Cursor、Claude Code、OpenRouter 的 X 讨论串和独立开发者社区找;不要先接十个平台,先拿三份真实日志换到一次反馈。把结果做成一页链接,允许用户圈出“这次不该发生”的失败点,下一版只解决被圈得最多的一项。若用户更偏业务端,换成一个 Google Sheet 的提醒与字段校验模板,同样只服务一个重复流程。
原始信息
以下公开来源链接用于核对本期事实;来源收集数量保留为编辑透明度说明。本次采集到 AI HOT 精选 18 条、AI 新闻 71 条、GitHub 趋势 53 条、Product Hunt 39 条和 X 41 条,五个来源均无抓取异常。
