特点 DeepSeek 发布的开源推理模型,通过强化学习(RL)驱动模型自发产生推理能力,无需监督微调(SFT)。在数学和代码任务上达到 OpenAI o1 水平,且完全开源。 参考资料 DeepSeek-R1