xAI 新模型 Grok 3 逻辑推理能力获 OpenAI 创始人点赞 - AI文章

作者：Eve Cole 更新时间：2025-05-28 04:50:01

埃隆・马斯克的人工智能公司 xAI 本周一发布了其最新的语言模型 Grok3，这一发布标志着该公司在人工智能领域取得了重要进展。马斯克在发布会上透露，新模型的计算能力是其前身的十倍，这得益于位于孟菲斯的数据中心，该中心配备了约20万块 GPU，为模型提供了强大的算力支持。

Grok3系列模型推出了多种变体，其中包括一个精简版，该版本在提高速度的同时牺牲了部分准确性。此外，新推出的“推理”模型专门设计用于解决数学和科学问题，用户可以通过 Grok 界面中的“思考”和“大脑”设置来调整这些功能。xAI 表示，这一版本尚未最终定型，模型仍在持续训练中，团队计划在未来几周内进行进一步的改进和优化。

根据 AI 基准测试平台 lmarena.ai 的数据，Grok3在聊天机器人领域的得分超过了1400，成为该领域的领先者。它在编程等所有类别中均表现出色，超越了 OpenAI、Anthropic 和谷歌的模型。然而，实际性能可能与基准结果有所不同。例如，尽管 Claude3.5Sonnet 在编码基准测试中的得分低于某些模型，但许多用户仍认为它是编程任务的更优选择。

OpenAI 创始人安德烈・卡尔帕西（Andrej Karpathy）获得了 Grok3的早期访问权，他对该模型的逻辑推理能力给予了高度评价。卡尔帕西表示，“思考”功能能够成功处理复杂任务，比如计算 GPT-2的训练 flops 或为棋盘游戏创建六边形网格，这些能力在之前仅限于 OpenAI 的高端模型 o1-pro。此外，该功能还提高了基本数学操作的准确性，比如字母计数和比较小数。

在新搜索功能方面，卡尔帕西指出，DeepSearch 的质量与 Perplexity 的研究工具相当，可以提供关于即将发布的苹果产品和 Palantir 股票动态等主题的相关答案。然而，他也发现了一些明显的问题：模型有时会生成虚假的网址，做出不支持的声明，并且仅在特定提示下引用 X 的帖子。

此外，Grok3似乎还对自己的存在缺乏意识，遗漏了 xAI 在主要 AI 实验室中的位置。这些局限性使 DeepSearch 尚未达到 OpenAI “深度研究” 的质量水平，并且在幽默和伦理问题上表现不佳。尽管如此，Grok3的发布仍然展示了 xAI 在人工智能领域的强大实力和创新能力。