GEOZ

Entity

DeepSeek V3

A 671B parameter Mixture-of-Experts (MoE) large language model trained on 14.8 trillion tokens for natural language processing.

术语属性

  • ArchitectureMixture-of-Experts (MoE)
  • Total Parameters671B
  • Activated Parameters per Token37B
  • Training Data14.8 trillion tokens
  • Training GPU Hours2.788M H800 GPU hours

相关文章