相比过去依靠更大规模预训练推动能力增长,o1 展示了另一种 scaling 方法:通过大规模强化学习,让模型学会投入更多计算进行推理。
06/25 00:17
06/25 00:16
06/25 00:15