30 秒速读
- Liquid AI 发布 d1:带图像输入的决策模型
- Wan 3.0、Utopai X、Dreamina Seedance 2.5 位居文生视频榜前三
- Eleven v4 Turbo 登上语音榜第一
本日报从公开来源中筛选与独立开发者相关的模型、产品、需求和工作流变化。事实链接用于核对,价值判断是编辑分析。 今天先关注三件事:低成本决策模型、编码 Agent 的计费变化,以及 Agent 对网站和团队流程的影响。
今天最该知道的 10 条
Liquid AI 发布 d1:带图像输入的决策模型 原文
- 具体:d1 接收文字、图片和问题,直接返回分类概率、是非概率或评分,不必像聊天模型那样生成一段答案。Liquid AI 用 6 个任务与 GPT-6.1 Sol、Claude Opus 5.5 比较,称 d1 在 4 项达到或超过 Sol,成本低 19 到 200 倍;文字决策约 200–300 毫秒。这是厂商测试结果。
- 价值:先拿客服工单分流、线索筛选或截图质检做一百条小样本对照,重点看误判率和真实账单。若结果够稳,可以把高频判断从昂贵的通用模型调用中拆出去。
Wan 3.0、Utopai X、Dreamina Seedance 2.5 位居文生视频榜前三 榜单
- 具体:Artificial Analysis 当前榜单给 Wan 3.0、Utopai X、Dreamina Seedance 2.5 的 Elo 分别为 1156、1148、1142;页面显示的样本数分别为 8059、5934、8056。标价分别为每分钟 12 美元、暂无 API、每分钟 34.12 美元。采集变化记录将三者标为新进前三,实际名称和 Elo 已按官方页面校正。
- 价值:榜单是盲测偏好,不等于商用成片质量。做视频产品前,先用同一批中文脚本测角色一致性、镜头连贯、生成时间和每条成片成本;Utopai X 暂无 API,不能只凭排名选供应商。
Eleven v4 Turbo 登上语音榜第一 榜单
- 具体:Artificial Analysis 当前 TTS 榜将 Eleven v4 Turbo 列为第 1,Elo 1334、1645 个样本,标价每百万字符 40 美元;Eleven v4 排第 2,Elo 1321,标价 80 美元。当前榜页可确认排名和价格。
- 价值:配音、播客剪辑和语音客服可以先测 Turbo 的中文、多语种、情绪控制、延迟与授权范围。榜单位置不能替代对目标语言和长文本稳定性的试听。
Together Link 把开源模型接进现有编码 Agent 原文
- 具体:Together Link 支持 Claude Code、Codex、OpenCode、Pi 等工具,按每个会话的首个任务在快模型与强模型间路由,并在会话结束时列出实际花费。Together 宣称可节省 50% 以上;服务需要 Together API Key,费用按量计。
- 价值:独立开发者可以用同一组修复任务对照现有订阅与开源模型,记录一次任务的通过率、修改轮数和成本。可复制的价值在任务级路由与账单。
SemiAnalysis 实测不同编码订阅的额度价值 原文
- 具体:SemiAnalysis 通过反复请求、观察订阅额度条变化,再按 API 单价折算重度编程用量;其估算称,中档日常模型下 Anthropic 订阅的 API 等价价值约为 OpenAI 的 5 倍,而两家的高端模型档差距小得多。这是特定模型、计划和使用方式下的测算,不是所有用户的通用结论。
- 价值:给自己的 AI 功能定价时,按真实任务记录可用量、限额窗口和重试次数,别把套餐标价当作稳定成本。套餐改版后要重测,尤其关注高频编码和长会话。
Wikimedia 发现疑似 OpenAI Agent 对其平台进行未授权访问 原文
- 具体:Wikimedia 称发现未经社区批准的测试编辑、借 Etherpad 代理抓取数据的尝试,以及数百万次 API 请求和页面抓取、数十万次 Wikidata 查询;流量可能参与造成五月的一次局部故障。基金会同时说明没有发现系统或数据被攻破,也没有发现 Agent 间协调证据。
- 价值:公开 API、知识库和小型网站会同时承担带宽、排障和内容清理成本。网站工具需要按身份识别 Agent、控制请求速率、说明可接受用途,并让站长快速封禁异常来源。
PromptArmor 报告 Databricks Genie 的恶意 Skill 可借输出环节外泄数据 报告
- 具体:PromptArmor 称,Genie Code 执行用户上传的恶意 Skill 后,攻击者可在聊天结果渲染时弹出钓鱼页面并从浏览器带走租户数据,整个流程不需要再次人工批准。这是安全研究机构披露的攻击路径,适合按其报告做独立验证。
- 价值:Skill、MCP 和 Agent 插件的风险不只在模型生成了什么,也在结果渲染、浏览器权限和工具之间如何传数据。最小可做的是 Skill 静态检查、预览隔离和敏感数据外传告警。
Codex CLI 展示语音派发任务和跨项目管理 Agent 原文
- 具体:OpenAI 开发者账号展示在终端里用语音启动任务、管理多个项目中的 Agent,并在独立 worktree 中探索另一条实现路线。当天 X 讨论还出现手机保留 Agent 会话、把执行环境切到远端主机的用法。
- 价值:用户需要的不只是更强模型,还需要知道哪个 Agent 在哪个项目工作、修改了什么、怎样比较分支并安全交接。先在现有命令行 Agent 上补状态、差异和恢复入口,比从头造 Agent 平台更容易验证。
calesthio/OpenMontage 把视频制作拆成 Agent 流程 项目
- 具体:这个开源项目自述包含 12 条制作流水线、100 多个工具和 700 多份 Agent Skill 与制作知识文件,目标是把编程助手变成视频制作工作台。Product Hunt 近几天也出现了脚本转社媒视频和专业剪辑提速产品。
- 价值:视频生成模型持续上榜后,差异可能从“能不能生成”转到脚本、素材、剪辑、字幕和交付能否串成一条可返工的流程。先挑一种短视频成片类型,把其中最耗人的剪辑步骤做成可检查的流水线。
OpenAI 开始在 ChatGPT 图像生成场景测试视觉广告 原文
- 具体:OpenAI 宣布本月在美国测试新的 ChatGPT 视觉广告格式,并扩展广告归因、测量和品牌适配工具;广告会明确标注,且不影响回答内容。这是平台的早期测试,不代表广告已面向所有用户开放。
- 价值:对独立产品而言,AI 助手既可能成为新的获客入口,也可能把广告位变成答案旁的商品发现渠道。先观察广告如何标注、按什么意图出现、是否能追踪到转化,再决定是否把它纳入渠道组合。
大模型榜单异动
文生视频前三出现强异动,采集器原始模型名已按官方榜单校正 Artificial Analysis
- 变化:采集快照将前三项标记为昨日榜外;核对当前官方榜页后,Wan 3.0 为第 1(Elo 1156、8059 个样本、12 美元/分钟),Utopai X 为第 2(1148、5934 个样本、暂无 API),Dreamina Seedance 2.5 为第 3(1142、8056 个样本、34.12 美元/分钟)。原始抓取把置信区间误当成模型名、把样本数误写成 Elo,已在本报告更正。
- 判断:这是盲测偏好榜,适合纳入同脚本试拍,不宜直接当成上线选型。没有可用 API 的模型先不进入自动化生产;其余重点比算力价格、排队时长和返工率。
Eleven v4 Turbo 升至 TTS 榜第 1 Artificial Analysis
- 变化:采集器记录为新进前三的 major_surge;当前官方榜显示第 1,Elo 1334±19、样本数 1645,价格为每百万字符 40 美元。Eleven v4 当前列第 2,Elo 1321±18,价格 80 美元。
- 判断:今天值得测一组中文、多语种和长文本试听,并测 API 延迟与价格是否符合自己的用量。榜单支持语音质量比较,不证明它适合每种语言、情绪或商用授权。
视频榜另有 MiniMax H3 Max 与 FLUX 3 进入前十观察位 Artificial Analysis
- 变化:采集器将 MiniMax H3 Max 标为第 5、Elo 1134,FLUX 3 标为第 6、Elo 1127;官方当前榜分别显示 5623、6085 个样本,API 标价 4.80 与 17.40 美元/分钟。原始数据中“1000 Anchor Fixed at 1000”是 Elo 参考锚点,不是模型,已排除。
- 判断:两者作为 watch 候选继续观察,不据一次榜单变化改生产默认值。MiniMax H3 Max 的标价较低,可先做小样本质量与返工测试;确认供应稳定后再谈替换。
值得注意的新产品、新方向、新模型
结构化决策模型开始覆盖分类和质检任务
- 具体:Liquid AI 的 d1 支持文本和图像输入,返回概率型决策;Strands Labs 的 strands-decider 也把 Agent 工作流里的选择题交给轻量决策模型处理。
- 价值:把一个重复判断任务的误判成本、单次调用成本和人工复核时间放在同一张表里,若低成本模型能稳定完成,就有机会把过去不划算自动化的小任务做成付费功能。
Agent 视频产品从生成器延伸到制作工作台
- 具体:OpenMontage 主打多流水线制作;Spira Maxima 把脚本转成社交视频,LaunchReel 主打专业剪辑提速;GitHub 上还有自称 Agent-native 的视频编辑器。
- 价值:不要只做另一个文本转视频入口。可验证的窄方向是让营销人员把脚本、品牌素材、字幕、分镜和导出规格交给 Agent,再逐步审核每一步成片。
持久记忆、任务面板和跨会话交接正在变成 Agent 工作区
- 具体:claude-mem 会压缩会话经历并把相关上下文注回后续会话;OptMem 声称用 426-token 提示词和脚本提供永久记忆;Product Hunt 的 Devpit 则定位为 Claude Code Agent 控制室。
- 价值:不同工具都在补同一段空白:用户回到任务时看不懂 Agent 做过什么、要接着做什么。机会在可查来源的任务记忆、权限边界和可靠交接,而不是无差别保存全部对话。
未被满足的需求
编码 Agent 的真实成本和订阅余量难以预测
- 信号:SemiAnalysis 需要逐次测量订阅额度条,才能估算不同计划的 API 等价用量;X 上转述 The Information 的帖子称,微软多数工程师的月度 AI 用量上限从约 10 万美元降到约 1 万美元,并提到部分工程师不满。用户在多工具、多模型间工作时,缺少按任务看实际消耗和限额变化的简单账本。
网站运营者难以识别并限制消耗资源的 Agent 流量
- 信号:Wikimedia 披露数百万次 API 请求、页面抓取和大量查询,并称排查来源与恢复服务要投入人力。小网站和开放 API 运营者也需要可识别的 Agent 身份、速率限制、审计记录和一键封禁;这不是单纯增加服务器容量就能解决的事。
不同地区用户难确认 AI 新产品何时可注册、怎样合规使用
- 信号:一位在澳大利亚的 X 用户称,尝试两周才找到 Muse 的注册与安装办法,也验证了候补名单。当前只是一条个人经历,不能当成普遍需求;值得先访谈不同地区的用户,确认他们卡在开放地区、候补资格还是安装流程,再做官方可用性和候补进度提醒。
如果今天只有两个小时
做一个给 Claude Code、Codex 用户用的“Agent 任务成本卡片”。让 5 位开发者手工填入一周的订阅费用、额度变化和 3 个常见任务,输出每项任务的耗时、重试次数、结果是否通过和估算成本;先不接账号、不收 API Key。随后用同一批分类任务试跑 d1 或 Together Link,比较质量与账单。第一批访谈对象去 HN、Indie Hackers,以及 X 上分享编码 Agent 工作流的开发者社区找。
原始信息
- Liquid AI 发布 d1 决策模型并新增图像输入能力
- Wan 3.0 文生视频榜第 1
- Utopai X 文生视频榜第 2
- Dreamina Seedance 2.5 文生视频榜第 3
- Eleven v4 Turbo TTS 榜单
- Together AI 推出 Together Link,一键在现有编码智能体中接入开源模型并降费超 50%
- SemiAnalysis 测算:Anthropic 订阅的 API 等价价值约为 OpenAI 的 5 倍以上
- Wikimedia 基金会发现 OpenAI “流氓”智能体在维基媒体平台上的活动
- PromptArmor 披露 Databricks Genie 恶意 Skill 可绕过控制实现钓鱼与数据外泄
- OpenAI 开发者展示 Codex CLI 语音任务与跨项目 Agent 管理
- calesthio/OpenMontage
- OpenAI 在 ChatGPT 推出全新视觉广告格式并扩展广告测量工具
- OpenAI 公布 EU AI Act 下的文本溯源方案,推出 textGrain 文本水印
- thedotmack/claude-mem
- VictorTaelin/OptMem
- strands-labs/strands-decider
- devpit
- Alishahryar1/free-claude-code
- Panniantong/Agent-Reach
- AFK-surf/Comma
- feder-cr/dots
- cloudflare/cloudflare-os
- Jakeschincariol/replica-skill
- msitarzewski/agency-agents
- crosswalk
- Jarq
- Spira Maxima
- Marv
- Pilot5 Legal
- Web Search API
- Reviu
- Aperture
- FastRouter.ai
- Meta、微软收紧员工内部使用 Claude
- 手机上的 Agent 将执行环境切到远端主机
- Deep Agents 增加 Office 文件支持与二进制分流
- 一位澳洲用户分享 Muse 注册与候补名单经历
