Яндекс открыл новую основу для будущей Алисы AI
Alice AI Foundation LLM обучена с нуля, работает по схеме MoE и доступна разработчикам под Apache 2.0.
Ключевое уточнение в этой новости — слово Foundation. Яндекс открыл не готовую чат-модель, которую можно напрямую поставить вместо нынешней Алисы, а претрейн: базовую языковую модель после основного этапа обучения. На этом уровне система уже обладает знаниями, умеет продолжать текст, решать часть математических и программных задач, но для устойчивого диалога, следования инструкциям и безопасной работы в пользовательском сервисе ей ещё требуется последующее дообучение.
Модель называется AliceAI-Foundation-80B-A3B-Base. В ней 80 млрд параметров, однако архитектура Mixture of Experts не задействует их все одновременно. Для обработки каждого токена активируются около 3 млрд параметров. Такой принцип позволяет сохранить большую общую ёмкость модели, но сократить объём вычислений на один шаг генерации. Это не превращает 80-миллиардную сеть в маленькую модель: все веса по-прежнему нужно хранить и загружать, зато во время ответа работает лишь выбранная часть «экспертов».
Яндекс сообщает, что модель обучена полностью с нуля — без использования весов сторонних открытых моделей. Для неё заново собирали обучающий корпус, подбирали архитектуру и гиперпараметры. Общий объём обучения составил около 18 трлн токенов. В техническом описании указана длина контекста до 262 144 токенов — это позволяет работать с очень большими массивами текста за один проход.
Сама архитектура заметно отличается от простого плотного трансформера. В ней 48 блоков, MoE-слои с сотнями специализированных экспертов и гибридная схема внимания. Инженеры отдельно оптимизировали обмен данными между видеокартами: пересылка данных идёт параллельно с вычислениями, что, по данным компании, примерно вдвое ускорило отдельные шаги оптимизации. Для отбора обучающих данных использовался каскад классификаторов, чтобы дорогие модели оценивали только уже отфильтрованную часть корпуса.
Отдельный акцент Яндекс сделал на русскоязычных знаниях. Вместе с моделью опубликованы два собственных набора тестов — WikiWebFacts и HardMultiQA. Первый проверяет знание дат, событий, определений и персоналий, второй собран на основе обезличенного потока запросов к Алисе AI и включает более редкие темы — от права и медицины до IT и искусства. Компания также открыла эталонные ответы и протоколы оценки, поэтому результаты можно воспроизвести самостоятельно.
По внутренним замерам Яндекса, новая модель на ряде задач сопоставима с более крупными открытыми системами, а в некоторых тестах по программированию, математике и русскоязычным фактам их превосходит. Эти сравнения пока следует воспринимать именно как результаты разработчика: модель вышла только сейчас, и независимых воспроизводимых проверок её заявленного преимущества ещё недостаточно. Открытые веса и публичные протоколы делают такую проверку возможной.
Практический смысл релиза шире самого набора бенчмарков. Веса опубликованы на Hugging Face под лицензией Apache 2.0. Разработчики могут запускать модель самостоятельно, исследовать её архитектуру, дообучать под собственные задачи и использовать результат в коммерческих проектах. Релиз означает, что крупная базовая модель доступна не только через закрытый облачный сервис, а как набор весов, который можно развернуть самостоятельно.
Для самой Алисы значение ещё важнее. По формулировке Яндекса, Alice AI Foundation LLM служит экспериментальной площадкой для архитектурных решений будущей единой рассуждающей модели. Уже эта следующая система должна стать основой агентных возможностей Алисы AI — сценариев, где помощник не просто отвечает текстом, а выполняет последовательность действий по поручению пользователя.
Поэтому говорить, что опубликованная модель уже является «новой Алисой», преждевременно. Скорее Яндекс открыл технологический фундамент и одновременно вынес часть своей исследовательской работы наружу. Если архитектура подтвердит заявленные характеристики в независимых тестах и последующем дообучении, главный эффект релиза проявится не в сегодняшнем чате, а в том, насколько быстро из этой базы получится собрать устойчивого рассуждающего агента.
Открытие весов меняет здесь сам характер проверки технологии: сравнивать заявления компании теперь можно не только по презентации, а на собственной инфраструктуре и со своими данными. Для фундаментальной модели это почти столь же важно, как число параметров — её дальнейшая ценность будет зависеть от того, что независимые разработчики смогут из неё получить.
Фото: редакция ИЗНАНКИ.