阿里最新开源推理模型发布：性能比肩DeepSeek-R1

阿里通义发布最新开源推理模型，称其性能比肩DeepSeek-R1。

3月6日凌晨，阿里巴巴正式发布最新的开源推理模型通义千问QwQ-32B。据介绍，通过大规模强化学习，千问QwQ-32B在数学、代码及通用能力上实现质的飞跃，整体性能比肩DeepSeek-R1，同时大幅降低了部署使用成本，在消费级显卡上也能实现本地部署。QwQ-32B采用了Apache 2.0开源协议，目前，所有人都可免费下载及商用QwQ-32B模型，或通过网页版Qwen Chat进行体验，该模型也将免费上架通义APP。

阿里通义团队表示，QwQ-32B模型拥有320亿参数，其性能可与具备6710亿参数（其中370亿被激活）的DeepSeek-R1媲美。在冷启动的基础上，模型针对数学和编程任务、通用能力分别进行了两轮大规模强化学习，在32B的模型尺寸上获得了令人惊喜的推理能力提升，印证了大规模强化学习可显著提高模型性能。

此外，QwQ-32B模型中还集成了与智能体（Agent）相关的能力，使其能够在使用工具的同时进行批判性思考，并根据环境反馈调整推理过程。

千问QwQ-32B既能提供极强的推理能力，又能满足更低的资源消耗需求，这背后的奥秘便在于强化学习（Reinforcement Learning）。阿里通义团队表示：“我们希望，我们的一点努力能够证明强大的基础模型叠加大规模强化学习也许是一条通往通用人工智能（AGI）的可行之路。”

在一系列权威基准测试中，千问QwQ-32B模型都表现出色，几乎完全超越了OpenAI去年9月发布的尺寸相近的o1-mini模型，比肩最强开源推理模型DeepSeek-R1：在测试数学能力的AIME24评测集上，以及评估代码能力的LiveCodeBench中，千问QwQ-32B表现与DeepSeek-R1相当，远胜于o1-mini及相同尺寸的R1蒸馏模型。