今天一早,SpaceXAI 推出了其最强模型 Grok 4.7。
发布页面开头仅有一句极具“挑衅”意味的定位:这是专为编程与知识工作打造的最强模型,运行速度是同类产品的两倍,而价格仅为一半。

这次升级并未停留在跑分数据上。Grok 4.7 采用了更大的基础模型,强化了处理长时间任务、自我校验及长上下文管理的能力,并将文档、演示文稿、法律、医疗和工程等专业工作纳入重点测试范畴。它瞄准的应用场景十分明确:让模型在持续数小时的任务中减少弯路,直接产出可用的结果。

马斯克在推文中表示,“Grok 4.7 在智能水平、运行速度和成本之间取得了极具竞争力的平衡。”

长任务,成为这一代模型的核心战场
Grok 4.7 使用了比 Grok 4.6 更大的基础模型。训练阶段延长了强化学习周期,任务组合的难度也进一步提高,其中许多样本需要数小时才能完成。SpaceXAI 表示,新模型在自我工作审查和长上下文管理方面均有改进。
这类改进直接针对当前编程智能体面临的最棘手问题。短代码生成往往只需局部判断,而真正复杂的软件任务则包括阅读仓库、拆解需求、修改多处文件、运行测试和反复纠错。模型能否在漫长的执行链条中保持目标、发现错误,通常比一次性写出漂亮代码更为关键。
CursorBench 4.0 专门用于评估长时间编码任务。官方数据显示,Grok 4.7 得分为 46.3%,Grok 4.6 为 40.4%,提升了 5.9 个百分点。在 DeepSWE v1.1 上,Grok 4.7 在高推理强度下的成绩为 71.0%;Terminal-Bench 4.0 的得分则从上一代的 20.3% 升至 38.0%。
据此,Grok 4.7 被称为 CursorBench 4.0 上价格与性能均处于前沿的模型。

该模型还被训练为原生理解 Grok Bot 的运行框架。据官方说法,这一调整改善了对话任务和通用知识工作的表现。换句话说,Grok 4.7 的升级重点已从单轮回答延伸到模型与工具、执行环境之间的持续协作。
从写代码,迈向完整的知识工作
编程仍然是 Grok 4.7 最显著的标签,但 SpaceXAI 给出的评测范围明显更广。AA Briefcase 和 GDPval 关注的是专业人士日常完成的多步骤工作,涵盖律师、护士、金融分析师等岗位的常见任务,也包括文档和演示文稿制作。
在 AA Briefcase v1.1 上,Grok 4.7 获得 1657 分,高于 Grok 4.6 的 1546 分;GDPval Elo 分数由 1605 升至 1695。官方图表显示,它在 GDPval 上接近 Fable 5.1 的 1735 分,高于 GPT-6 Astra 的 1542 分。SpaceXAI 的结论是,Grok 4.7 在这两项测试中均超越上一代,整体表现与其他前沿模型相当。

专业领域的提升也体现在多个方向。EEBench 得分从 53.0% 升至 64.0%,Harvey Legal Agent Benchmark 从 15.8% 升至 19.6%,HealthBench Professional 从 48.5% 升至 56.7%。这些结果来自 SpaceXAI 公布的内部对比表,能够反映新旧两代模型之间的变化;跨模型比较仍会受到推理强度、工具配置和测试环境的影响。
这组成绩透露出一个清晰趋势:前沿模型的竞争正进入“完成整项工作”的阶段。
模型需要理解任务、调用工具、产出文件并自行复核,单一问答能力只是其中一环。Grok 4.7 通过延长训练任务时长并强化自我验证,正是在为这类工作流补课。
安全与价格
能力提升之外,Grok 4.7 还启用了一套全新的安全防护体系。SpaceXAI 称,这是其测试过的模型中,在拒答与抵抗越狱方面表现最强的一款。
在生物安全评测方面,Grok 4.7 以 62.4% 的成绩登顶 LatchBio 基准。网络安全测试 HackerBench v0.3 主要覆盖高风险和恶意任务。据官方数据,模型仅放行 3.3% 的高风险双重用途提示,同时很少误拦正常的安全研究请求。
SpaceXAI 还开始向少数网络安全合作伙伴开放邀请制红队能力,用于防御研究。目前,这项红队能力先以受控合作方式提供。
标准版延续原价,快速版速度翻倍
Grok 4.7 已上线 Cursor 和 Grok Build,并通过 Grok API、第三方编程框架、模型路由服务及云平台提供。标准版起价为每百万输入 Token 2 美元、每百万输出 Token 6 美元,与 Grok 4.6 保持一致。
价格策略让这次升级更具冲击力。开发者无需为换代支付额外的标准版 Token 成本,却能获得更强的长任务表现、自我检查能力和专业工作成绩。
对编程智能体与知识工作产品而言,模型每次调用的单价固然重要,完成一项任务需要多少轮尝试、多少次返工,最终决定了真实成本。
最后总结一下这次升级:
从训练方式到评测组合,Grok 4.7 都在强化同一件事:长时间留在任务中,把复杂工作做完。编程只是最先成熟的入口,文档、演示、法律分析、临床推理和工程任务已被纳入同一套能力版图。
但网友似乎并不买账,“这种模型居然也敢发布,简直差到不该发布。”只能挽尊地说,这次 Grok 4.7 的卖点并非全面碾压竞品,而是以远低于部分旗舰模型的 API 成本,换来了相当接近、并在个别专业任务上领先的性能。

参考链接:
https://x.com/ArtificialAnlys/status/2102074904560771365
本文来自微信公众号“机器之心”,编辑:机器之心编辑部,36氪经授权发布。
九游娱乐体育围绕聚合经典游戏背景资料与核心要点,辅助玩家更从容地理解作品脉络。不断创新,回应用户的真实需求。
精选成就收集与解读合二为一,帮助用户系统梳理游戏历程。内容,九游娱乐体育与你一同发现更多精彩。
5条评论


Emilly Blunt
2017年12月4日下午3:12
九游娱乐体育专注定期发布作品征集活动信息,参与规则以正式公告为准。,为用户提供专业可靠的体验。