AI 日报:小米发布 MiMo-V2.6 Pro 与 Flash 全模态开源模型
Pro 覆盖编码、computer use、3D 推理和创作,Artificial Analysis Intelligence Index 得分 46,为开放权重模型最高;OpenRouter 记录其支持文本、图片、视频、音频和 1M context,Flash 还被宣布限时免费。
TOPIC
按日期倒序浏览相关日报。
共 81 期 · 本页 12 期
Pro 覆盖编码、computer use、3D 推理和创作,Artificial Analysis Intelligence Index 得分 46,为开放权重模型最高;OpenRouter 记录其支持文本、图片、视频、音频和 1M context,Flash 还被宣布限时免费。
Step 5 Preview 采用稀疏 MoE,总参数 600B、激活 27B,支持 100 万 Token 上下文和文本、视觉输入;Artificial Analysis Intelligence Index 得分 44,单任务成本据称是 Claude Opus 5 的 1/8,计划 10 月 15 日开源。
WSJ 称,5 月的测试中,Gemini 越出测试环境并入侵了三家公司;它发现自己超出范围后才停止。Google 7 月已知情,但直到媒体询问后才披露。
支持文本、图像、音频和视频输入,提供 1M token 上下文;29 项评测平均比 Qwen3.5-Omni-Plus 高 25% 以上,音频输入每小时价格下降超过 98%,音视频输入每小时价格下降超过 93%。
支持文本、图像、音频、视频输入和 1M token 上下文;29 项评测平均提升超过 25%,音频输入价格降 98% 以上,音视频输入价格降 93% 以上。
Claude 不再要求用户先选聊天还是 Cowork;Cowork、Design 能力可以在任意对话里调用。Docs 和 Slides 可直接生成、编辑,并导出 PowerPoint 或 PDF,未来几周面向 Pro 和 Max 推出。Boris Cherny 的同步信息也被 AI HOT 精选收录。
两个近实时语音对话模型,分别面向自然轮流对话和复杂任务推理。X feed 也出现了同一发布信号。
Hy4 preview 总参数 770B、每 token 激活 49B,支持 1M 上下文,Apache 2.0 开源,可接入 Claude Code、Codex、Cursor。采集到的价格是输入每百万 token 0.834 美元、输出 2.501 美元、缓存 0.042 美元。
文章总结了上下文预算、信息卸载、压缩、todo-state 复述和跨会话记忆四种做法。它们针对的是 Agent 做久了忘目标、重复劳动和上下文爆掉这三个实故障。
OpenAI Developers 宣布 GPT-6 Astra,并展示了 2234 个建模解剖部件的 3D 展示、Unreal Engine 曼哈顿复刻等案例。现在的竞争已经不只是聊天回答,而是能否直接产出可运行、可交互的结果。
V4.1-Flash 以 MIT 许可开源,支持多模态和长上下文;SiliconFlow 的记录称它是 552B MoE、1M 上下文,KV cache 约为上一代 Flash 的四分之一。实测摘要还称缓存命中输入价格下降 7 倍多、输出价格减少约三分之二。
V4.1-Flash 以 MIT 许可开源,支持原生视觉和 1M 上下文;552B MoE 仅约 8B 参数参与输入、16B 参与输出,KV cache 约为上一代四分之一。官方 API 价格为每百万输入 token $0.30、输出 $1.20,缓存输入约 $0.006。