AI 日报:MAI-Image-2.6-Preview 在 Image/Editing 进入第一名
Artificial Analysis 记录它昨日还在榜外,今天以 Elo 1285 进入 Image/Editing 第一名,级别为 major_surge。榜单变化很大,但还没有给出 API 价格和稳定性证据。先拿同一组中文海报、修图和局部重绘任务实测。
TOPIC
按日期倒序浏览相关日报。
共 81 期 · 本页 12 期
Artificial Analysis 记录它昨日还在榜外,今天以 Elo 1285 进入 Image/Editing 第一名,级别为 major_surge。榜单变化很大,但还没有给出 API 价格和稳定性证据。先拿同一组中文海报、修图和局部重绘任务实测。
ChatGPT Work 把 Codex 改成面向非工程师的多步骤工作工具,最低订阅档每月 20 美元。OpenAI 内部 Codex 使用率达 98%,但组织订阅者只有 17%,个人订阅者不足 1%。
Anthropic 建议用 `intent.md` 固定需求,用技能文件编码标准,用持续评测替代一次性阶段门禁,并保留人工审查。它判断代码生成已经不是主要瓶颈,规划、验证和部署才是。
Anthropic 把 Computer Use、Skills API、Files API 和浏览器操作工具放进 Claude Platform,Agent 可以操作软件、调用团队技能并返回文件。它已经不是只回答问题,而是接收任务、使用工具、交付结果。
GLM-5.3 API 已上线,官方称其在 AA 综合智能指数获 60 分、与 Kimi K3 并列开源第一;定价与 5.2 持平,权重计划下周开放。
Artificial Analysis 给出的 Intelligence Index 为 60,和 Kimi K3 持平,较 GLM-5.2 高 7 分;OpenRouter 同日称它已可用,Terminal-Bench 3.0 从 4.6 升到 28.3,DeepSWE v1.1 从 46.2 升到 66.。
OpenAI 说自己曾低估模型的真实网络攻击能力;现在用 Codex 验证漏洞、让智能体先分流安全告警、持续枚举攻击路径,并限制高风险能力的开放对象。文中案例是 ChatGPT Work 15 分钟发现个人网站 13 个问题,一小时完成修复。
Cursor 宣布已完成被 SpaceX 收购的流程,并称将借助后者的大规模 GPU 集群做更强、运行成本更低的模型;原始信息把 Grok 4.6 列为早期合作成果。
Gemini 3.7 Flash 主打编程和智能体任务,输入/输出价格为每百万 token 0.75/3.75 美元,是 3.6 Flash 的一半;已进入 Gemini Pro、Ultra 和 Workspace 工具调用场景。
GPT-5.6 增加推理持久化、原生多智能体编排和程序化工具调用。官方案例中,Sol 启用保留推理与压缩后,ARC-AGI-3 从 13.3% 到 38.3%,输出 token 约少六倍;Luna 的 BrowseComp 成本从 33.27 美元降到 1.33 美元。
Qwen-Max 级模型首次开放权重;总参数 2.4T、每个 token 激活 95B,原生上下文 262,144 token,并称可扩到约 101 万 token。
这是开放权重的 30B MoE 模型,面向常驻 agent;NVIDIA 称相较同类开源模型 token 生成最高快 4 倍、任务完成时间缩短 30%,可在 RTX PC、DGX Spark 和 Jetson 上运行。SGLang 已提供 Day-0 支持,含 1M 上下文、OpenAI 兼容 API 和多种。