埃隆・马斯克的人工智能公司 xAI 本周一发布了其最新的语言模型 Grok3,这一发布标志着该公司在人工智能领域取得了重要进展。马斯克在发布会上透露,新模型的计算能力是其前身的十倍,这得益于位于孟菲斯的数据中心,该中心配备了约20万块 GPU,为模型提供了强大的算力支持。
Grok3系列模型推出了多种变体,其中包括一个精简版,该版本在提高速度的同时牺牲了部分准确性。此外,新推出的“推理”模型专门设计用于解决数学和科学问题,用户可以通过 Grok 界面中的“思考”和“大脑”设置来调整这些功能。xAI 表示,这一版本尚未最终定型,模型仍在持续训练中,团队计划在未来几周内进行进一步的改进和优化。
根据 AI 基准测试平台 lmarena.ai 的数据,Grok3在聊天机器人领域的得分超过了1400,成为该领域的领先者。它在编程等所有类别中均表现出色,超越了 OpenAI、Anthropic 和谷歌的模型。然而,实际性能可能与基准结果有所不同。例如,尽管 Claude3.5Sonnet 在编码基准测试中的得分低于某些模型,但许多用户仍认为它是编程任务的更优选择。
OpenAI 创始人安德烈・卡尔帕西(Andrej Karpathy)获得了 Grok3的早期访问权,他对该模型的逻辑推理能力给予了高度评价。卡尔帕西表示,“思考”功能能够成功处理复杂任务,比如计算 GPT-2的训练 flops 或为棋盘游戏创建六边形网格,这些能力在之前仅限于 OpenAI 的高端模型 o1-pro。此外,该功能还提高了基本数学操作的准确性,比如字母计数和比较小数。
在新搜索功能方面,卡尔帕西指出,DeepSearch 的质量与 Perplexity 的研究工具相当,可以提供关于即将发布的苹果产品和 Palantir 股票动态等主题的相关答案。然而,他也发现了一些明显的问题:模型有时会生成虚假的网址,做出不支持的声明,并且仅在特定提示下引用 X 的帖子。
此外,Grok3似乎还对自己的存在缺乏意识,遗漏了 xAI 在主要 AI 实验室中的位置。这些局限性使 DeepSearch 尚未达到 OpenAI “深度研究” 的质量水平,并且在幽默和伦理问题上表现不佳。尽管如此,Grok3的发布仍然展示了 xAI 在人工智能领域的强大实力和创新能力。