Entity
DeepSeek V3
A 671B parameter Mixture-of-Experts (MoE) large language model trained on 14.8 trillion tokens for natural language processing.
术语属性
- Architecture:Mixture-of-Experts (MoE)
- Total Parameters:671B
- Activated Parameters per Token:37B
- Training Data:14.8 trillion tokens
- Training GPU Hours:2.788M H800 GPU hours