30 秒速读
- 腾讯混元发布 Hy4 preview:770B 总参数、1M 上下文,开源上线
- Gemini 3.5 Transcribe 完整指南:告别 ASR 转录难题
- 榜单观察:Wan 2.7 在 Video/Image-to-Video 明显上升
本日报从公开来源中筛选与独立开发者相关的模型、产品、需求和工作流变化。事实链接用于核对,价值判断是编辑分析。
今天最该知道的 10 条
腾讯混元发布 Hy4 preview:770B 总参数、1M 上下文,开源上线 原文
- 具体:Hy4 preview 总参数 770B、激活参数 49B,上下文长度 1M,已经开源,并在腾讯云 TokenHub 和 OpenRouter 上线。
- 价值:拿同一批长文档、代码库或多轮任务与现用模型对比。开放权重和多渠道调用会增加模型替代空间,也会带来部署、路由和评测需求。
Gemini 3.5 Transcribe 完整指南:告别 ASR 转录难题 原文
- 具体:支持 85+ 种语言自动识别与代码切换、说话人分离、词级毫秒时间戳、最多 1,000 个领域术语的 custom vocabulary,并提供 Smart Transcription 与 Verbatim 两种模式。
- 价值:转录产品的竞争点会从“变成文字”转向术语准确率、时间轴、说话人和可交付格式。垂直会议、客服质检、访谈整理仍有窄入口。
榜单观察:Wan 2.7 在 Video/Image-to-Video 明显上升 原文
- 具体:当前第 10 名,昨日第 11 名,Elo 1084,进入 Top 10,级别为 watch。
- 价值:这是待验证的模型替代信号。连续观察 3—7 天,再用固定提示词测试一致性、速度、价格和失败率。
榜单观察:Realtime TTS-2 Flash - Research Preview 在 Text-to-Speech 明显上升 原文
- 具体:昨日还在榜外,今天进入第 4 名,Elo 1226,级别为 watch。
- 价值:语音入口可能出现新的成本和延迟组合。先测首字节延迟、长文本稳定性和中英混说,不要只听演示音频。
diegosouzapw/OmniRoute 原文
- 具体:MIT 开源 AI Gateway 宣称提供一个端点、350 个 provider、1,200+ 个模型,支持额度感知回退、MCP/A2A,并用压缩策略节省 15%—95% token;项目由 450+ 位贡献者参与。
- 价值:模型调用已经是运营问题:哪家便宜、哪家可用、何时降级、请求是否缓存。可做某个团队的成本诊断、路由规则和故障回放。
tt-a1i/archify 原文
- 具体:这是生成架构图、工作流图、时序图、数据流图和生命周期图的 agent skill,输出自包含 HTML,并强调可验证和清晰导出。
- 价值:图表成为 agent 交付的一部分。把代码、配置和任务记录变成能审查、能分享、能更新的交付物,是明确的窄方向。
screenpipe 原文
- 具体:Product Hunt 的定位是“记录电脑工作,为 agents 提供能力”,把屏幕活动变成后续自动化的上下文。
- 价值:agent 的输入从聊天文本扩展到真实工作过程,但隐私、权限和误记录风险也更大。限定应用、限定时间的记录与可见删除控制更容易验证。
Firecrawl Developer Index 原文
- 具体:产品定位是为 coding agents 建立 7,000 万+ artifacts 的精选索引。
- 价值:资料变多后,瓶颈变成可信度、相关性和来源追溯。垂直资料索引、版本筛选和证据引用比泛搜索更有机会。
同样的 prompt 同样的模型,有人右边直接出可用产品…… 原文
- 具体:X 上的实践反馈认为,差距不只在 prompt,而在 Appllama MCP、skills、UI 和流程是否被拆成可复用能力。
- 价值:用户愿意复用能完成真实动作的技能包。可以从一个职业或一个软件开始做模板、权限、输入输出检查和分发。
coding is solved,除非 harness 在后台偷偷压缩上下文 原文
- 具体:X 上的 coding agent 用户抱怨 harness 未明确提示就 compact,直到模型开始“胡言乱语”才发现上下文已经变化。
- 价值:这暴露了长任务 agent 的可见性缺口。上下文压缩记录、任务树、文件改动、失败原因和恢复入口,比“模型更聪明”更容易先做出来。
大模型榜单异动
今天没有 major_surge,有 2 个 watch:
榜单观察:Wan 2.7 在 Video/Image-to-Video 明显上升 原文
- 变化:当前第 10 名,昨日第 11 名,Elo 1084,排名上升 1 位,首次进入 Top 10。
- 判断:加入视频模型候选池,用相同素材连续测试 3—7 天;只有质量、成本和速度同时更好,才替换现有模型。
榜单观察:Realtime TTS-2 Flash - Research Preview 新进 Text-to-Speech 第四名 原文
- 变化:当前第 4 名,Elo 1226,昨日榜外,级别为 watch。
- 判断:优先验证实时延迟、中文和英文混读、专有名词以及长音频稳定性。
值得注意的新产品、新方向、新模型
开放模型正在把模型选择变成可操作的工程工作。
- 具体:Hy4 preview 已开源并进入 TokenHub、OpenRouter;OmniRoute 把多 provider、多模型、额度回退和 token 压缩放在一个网关里;Replicate 宣布 Wan 3.0 周末半价。
- 价值:模型价格和可用性变化很快,产品应保存每次调用的模型、成本、延迟和结果,而不是把 provider 写死。
Agent 的输入层从 prompt 扩展到电脑、资料和过程记录。
- 具体:screenpipe 记录电脑工作;Firecrawl Developer Index 聚合 7,000 万+ coding artifacts;Graphify 把代码库、文档、SQL schema、配置和 PDF 做成可查询知识图谱。
- 价值:窄机会是限定来源的上下文工具,只接一个团队的代码库或一个职业的资料库,并让结论回到原文、文件或操作记录。
Skills、插件、可视化交付和多模态流水线正在成为新的产品层。
- 具体:GitHub 趋势出现 Anthropic 官方 Claude Code Plugins、awesome-claude-skills、Cursor plugins、agentmemory、archify 和 Agent Scientist;Product Hunt 还有 Slack/Teams AI coworker 和 vendor-neutral AI Agent Control Plane。
- 价值:用户购买的可能不是一个模型,而是一套能安装、能授权、能检查结果的工作能力。与此同时,Gemini 3.5 Transcribe 的说话人、词级时间戳和术语词表,Gemini Omni 1.1 Flash 的延长视频、首尾帧和 4K,以及 Midjourney V8.2 的多参考图和局部重绘,都把收费点推向素材整理、批处理、审核、字幕时间轴和导出规格的稳定流水线。先选一个软件和一个高频任务,比做全能 agent 更容易得到反馈。
未被满足的需求
长任务 agent 的过程不可见,出了错也难以恢复。
- 信号:X 用户明确抱怨后台压缩上下文却没有提示;archify、agentmemory、Graphify 和多个 agent plugin 同时出现在 GitHub 趋势中。用户需要看到上下文何时改变、模型改了什么、哪一步失败以及如何继续。
- 可验证入口:先支持一个 coding agent 的 session log,输出上下文变化、工具调用、文件 diff、失败节点和成本,不要一开始做全平台监控。
模型太多,团队没有简单可靠的降级、回退和成本解释。
- 信号:OmniRoute 把 350 个 provider、1,200+ 模型、额度回退和 token 压缩放在一起;Product Hunt 也出现 trajectory-aware routing 和 vendor-neutral control plane。用户想知道请求为什么贵、为什么慢、替代方案会损失什么。
- 可验证入口:接入一个 OpenAI-compatible endpoint,导入一周日志,按任务输出模型成本、失败率、延迟和切换建议。
语音转录用户需要可直接交付的文本。
- 信号:Gemini 3.5 Transcribe 把 85+ 语言、说话人分离、毫秒时间戳和领域词表作为核心能力,说明痛点已从“能否识别”转向专有名词、角色、时间轴和后续格式。
- 可验证入口:从销售电话或访谈开始,输出带说话人和时间戳的复盘稿,并允许用户修正术语词表。
如果今天只有两个小时
做一个“Agent 任务交付体检器”。第一版只接收一份 Claude Code、Codex 或 Gemini CLI session log,输出四张卡片:任务完成了什么、上下文何时被压缩、调用了哪些模型和花了多少钱、哪些文件或步骤需要人工复核。若日志没有完整成本,就显示调用次数、模型和可识别的失败节点,不伪造精确金额。
第一小时做解析器和 HTML 报告,第二小时准备 3 份真实或脱敏 session 做对比。第一批用户去 HN 的 coding agent 讨论、X 上抱怨 harness/context 的开发者、GitHub agent 项目 issue 和独立开发者社群找。验证标准是用户能指出一个此前不知道的浪费、失败或返工点,并愿意再次上传下一份日志。
原始信息
以下公开来源链接用于核对本期事实;来源收集数量保留为编辑透明度说明。本次采集:AI HOT 精选 15 条,AI 新闻 66 条,GitHub 趋势 57 条,Product Hunt 36 条,X 44 条。
- 腾讯混元发布 Hy4 preview:770B 总参数、1M 上下文,开源上线
- Gemini 3.5 Transcribe 完整指南:告别 ASR 转录难题
- 榜单观察:Wan 2.7 在 Video/Image-to-Video 明显上升
- 榜单观察:Realtime TTS-2 Flash - Research Preview 在 Text-to-Speech 明显上升
- diegosouzapw/OmniRoute
- tt-a1i/archify
- screenpipe
- Firecrawl Developer Index
- Run prompts on every model at once
- Trajectory-aware LLM routing that cuts agent cost
- AI coworker lives on Slack and Teams
- OpenRouter for Voice
- The open-source kernel for coding agents
- The first natively multimodal model in GLM-5 series
- Anthropic 让 Claude 自主训练模型以缓解对齐失败
- Gemini 3.5 Transcribe 发布:更精准的实时语音转写模型
- Gemini Omni 1.1 Flash 发布,为开发者提供更强生成式视频控制
- Terminal-Bench-Science 0.1:评估科研工作流中的 AI 智能体
- Open ASR 排行榜新增首个全球南方语言:印地语与印度英语评测集
- GLM-5.3 开源权重,智能体编码与网防最强
- Midjourney 开放 V8.2 图像编辑模型测试
- ComposioHQ/awesome-claude-skills
- Graphify-Labs/graphify
- rohitg00/agentmemory
- Agenta-AI/agenta
- Anthropic-managed Claude Code Plugins
- AI Engineer Notebooks
- OpenHands: AI-Driven Development
- Chrome DevTools for coding agents
- A framework for building realtime voice AI agents
- Turn any AI agent into an AI Scientist
- AI agent skill that researches Reddit, X, YouTube, HN and the web
- Persistent memory for AI coding agents
- Open-source CapCut alternative
- Zed: Edit predictions are leaving the free Personal plan
- TwitterWebViewer has been permanently discontinued
- I launched a project to see if people would pay for your Indie Hacker idea
- Advocat AI: contract workflow automation
- @replicate:Wan 3.0 周末半价
- @OpenAIDevs:Appshots 给 ChatGPT Work 和 Codex 提供当前 app 上下文
- @grok:Grok 4.6 已在网页、iOS 和 Android 上线
- @badlogicgames:coding agent 的上下文压缩提示问题
