Передовая open-source большая языковая модель с 671 млрд параметров, использующая архитектуру Mixture-of-Experts для эффективных и высокопроизводительных AI-задач.
DeepSeek V3 — это продвинутая AI большая языковая модель (LLM), использующая архитектуру Mixture-of-Experts (MoE) с общим числом параметров 671 млрд, из которых для каждого токена активируется только 37 млрд, что позволяет оптимально использовать ресурсы без потери производительности. Предобучена на 14,8 трлн высококачественных токенов, превосходно справляется со сложным рассуждением, программированием, многоязычным пониманием и обработкой длинного контекста (128K токенов). DeepSeek V3 интегрирует инновации, такие как Multi-Head Latent Attention (MLA), предсказание нескольких токенов и балансировку нагрузки без вспомогательных потерь, обеспечивая результаты на уровне ведущих закрытых моделей, таких как GPT-4, при этом сохраняя эффективный инференс и экономичное обучение. Поддерживает различные фреймворки и аппаратные платформы, доступен через API, веб-демо или локальное развертывание.
| Type | Model |
| Section | Coding & development |
| Pricing | has a free tier |
| Platform | Self-hosted |
| Systems | website |
| Hosting | cloud |
| Install | saas |
| Site language | ru |