---
license: apache-2.0
language:
- ru
- en
library_name: transformers
pipeline_tag: text-generation
tags:
- custom_code
- mixture-of-experts
- vllm
---
# AliceAI-Foundation-80B-A3B-Base
[English version](./README_en.md)
AliceAI-Foundation-80B-A3B-Base – базовая языковая модель с гибридной
архитектурой и MoE-слоями. Модель содержит 80 млрд параметров, из которых для каждого токена активируются 3 млрд, и поддерживает контекст длиной до 262 144 токенов. Модель была обучена полностью с нуля.
При создании модели мы заново собрали обучающий корпус, выбрали архитектуру и
гиперпараметры, а также подготовили данные для сложных рассуждений и
взаимодействия с инструментами. Ключевые решения проверялись в серии отдельных
обучений с нуля объёмом по 2 трлн токенов каждое.
В математике, программировании и других задачах на рассуждения модель показывает результаты на уровне более крупных опенсорс-моделей, а особенно сильна в задачах на фактические знания на русском языке. Вместе с весами мы публикуем фактологические бенчмарки
[WikiWebFacts](https://huggingface.co/datasets/yandex/WikiWebFacts) и
[HardMultiQA](https://huggingface.co/datasets/yandex/HardMultiQA), ориентированные на
русскоязычный контекст, и протоколы их оценки.
Подробно про эту модель можно прочитать в [статье на Хабре](https://habr.com/ru/companies/yandex/articles/1083300/).
## Обзор модели
- Тип: авторегрессионная языковая модель
- Этап обучения: предобучение
- Языковая модель
- Количество параметров: 80B всего, 3B активных
- Размер скрытого состояния: 2048
- Размер словаря: 129024
- Количество слоев: 48
- Схема слоёв: 12 × (3 × (KDA → MoE) → 1 × (Gated Attention → MoE))
- KDA:
- Количество query-голов: 32
- Количество KV-голов: 32
- Размерность query-головы: 128
- Размерность KV-головы: 128
- Рамер ядра свертки: 4
- Gated Attention:
- Количество query-голов: 16
- Количество KV-голов: 2
- Размерность query-головы: 256
- MoE:
- Количество экспертов: 512
- Top-K: 10 + 1 общий эксперт
- Промежуточная размерность эксперта: 512
- MTP: 1 слой
- Длина контекста: 262144
## Бенчмарки
Названия русскоязычных бенчмарков выделены зелёным, англоязычных — синим.
Все замеры в этом разделе проведены во внутренней инфраструктуре замеров, инференс в фреймворке vllm с t=0 для всех моделей. Жирным выделен победитель в каждой строчке.
| Бенчмарк | AliceAI-Foundation-80B-A3B-Base | Qwen3.5-35B-A3B-Base | GLM-4.5-Air-Base (106B-A12B) | Nemotron-3-Super-120B-A12B-Base | DeepSeek-V4-Flash-Base (284B-A13B) |
|---|---|---|---|---|---|
| Факты | |||||
WikiWebFacts5-shot, бенчмарк на знание фактов на русском языке. | 86.5 | 62.4 | 70.2 | 72.8 | 83.2 |
HardMultiQA5-shot, бенчмарк на знание фактов на русском языке. | 67.9 | 47.2 | 48.6 | 54.5 | 65.4 |
CultCat4-shot, бенчмарк на знание культурных фактов. Подробнее — в статье на Хабре. | 86.5 | 59.2 | 59.1 | 66.3 | 80.7 |
TriviaQA5-shot, открытый бенчмарк на знание фактов на английском языке; вместо метрики Exact Match используется LLM-as-a-judge. | 79.0 | 71.4 | 83.5 | 89.8 | 89.4 |
| Образовательные бенчмарки | |||||
EduBench Russian5-shot, бенчмарк образования, собранный на основе запросов к Алисе. | 74.2 | 42.9 | 39.0 | 44.0 | 67.7 |
EduBench Literature5-shot, бенчмарк образования, собранный на основе запросов к Алисе. | 73.8 | 51.8 | 51.4 | 55.8 | 69.1 |
EduBench History5-shot, бенчмарк образования, собранный на основе запросов к Алисе. | 82.0 | 65.9 | 62.8 | 70.2 | 76.9 |
EduBench English5-shot, бенчмарк образования, собранный на основе запросов к Алисе. | 76.1 | 71.7 | 67.2 | 71.3 | 82.9 |
| Экспертные знания | |||||
ExpertFactsQA Medicine5-shot, бенчмарк на фактические знания, составленный профильными экспертами. | 63.6 | 59.0 | 50.6 | 42.3 | 60.7 |
ExpertFactsQA LawСложный 5-shot, бенчмарк на фактические знания, составленный профильными экспертами. | 49.6 | 27.9 | 22.5 | 24.3 | 40.5 |
| Экзамены | |||||
EGE CoT5-shot, бенчмарк из заданий части А ЕГЭ по различным предметам. | 90.5 | 84.7 | 77.8 | 84.3 | 90.3 |
MMLU-Pro CoT5-shot, открытый бенчмарк на знания и рассуждения по широкому набору предметов на английском языке. | 66.8 | 63.2 | 58.4 | 69.9 | 66.5 |
SuperGPQA CoT5-shot, открытый бенчмарк с вопросами, составленными экспертами из разных научных областей. | 44.3 | 43.6 | 35.4 | 46.6 | 46.1 |
| Математика | |||||
MATH-5005-shot, бенчмарк с математическими задачами; используется LLM-as-a-judge и более длинные рассуждения в few-shot-примерах. | 91.1 | 81.9 | 60.2 | 84.8 | 80.7 |
EduBench Math5-shot, бенчмарк образования, собранный на основе запросов к Алисе | 79.3 | 80.0 | 56.9 | 69.7 | 76.3 |
EduBench Math University5-shot, бенчмарк образования, собранный на основе запросов к Алисе. | 70.1 | 69.9 | 51.4 | 67.4 | 68.6 |
| Код | |||||
BigCodeBench 1-shot pass@11-shot, наша реализация BigCodeBench с улучшенными тестами. | 48.3 | 43.5 | 44.5 | 48.8 | 49.1 |
LiveCodeBench v5-6 CoT 1-shot pass@11-shot, открытый бенчмарк со сложными задачами по программированию, в которых требуется найти алгоритм и реализовать его в коде. | 50.5 | 50.4 | 22.6 | 50.4 | 38.1 |
| Длинный контекст | |||||
FinQA 128k5-shot, длинная модификация опенсорсного FinQA, задачи на аналитику по финансовым отчётам. | 74.1 | 73.5 | 35.5 | 71.7 | 74.1 |
LongMemEval 128k5-shot, открытый бенчмарк с задачами на поиск и использование информации из длинной истории диалога. | 64.6 | 55.6 | 50.6 | 64.8 | 68.0 |
Все замеры в этом разделе проведены во внутренней инфраструктуре замеров, инференс в фреймворке vllm с t=1 и штрафами за повторы (repetition_penalty=1, presence_penalty=1.5) для всех моделей. Жирным выделен победитель в каждой строчке.
| Бенчмарк | AliceAI-Foundation-80B-A3B-Base | Qwen3.5-35B-A3B-Base | Nemotron-3-Super-120B-A12B-Base |
|---|---|---|---|
| Сложные рассуждения | |||
AIME 2026 pass@320-shot, задачи American Invitational Mathematics Examination. | 96.7 | 96.7 | 90.0 |
HMMT 2026 Feb pass@320-shot, задачи февральского математического турнира Harvard–MIT. | 96.9 | 87.9 | 66.7 |
IMO Answerbench pass@80-shot, задачи Международной математической олимпиады. | 88.7 | 84.5 | 64.5 |
CodeForces CPP pass@80-shot, соревновательные задачи Codeforces на C++. | 68.9 | 73.7 | 56.6 |
LiveCodeBench v5-6 pass@10-shot, открытый бенчмарк с задачами на поиск и использование информации из длинной истории диалога. | 60.4 | 51.9 | 34.7 |
LiveCodeBench v5-6 pass@80-shot, открытый бенчмарк с задачами на поиск и использование информации из длинной истории диалога. | 82.9 | 82.1 | 59.8 |