Kimi K3: большой обзор нейросети от Moonshot AI — архитектура, бенчмарки, открытые веса, сравнение с Fable 5

kimi k3

Moonshot AI опубликовала Kimi K3 — первую открытую модель класса 3 триллионов параметров и контекстом 1 миллион токенов. Она уже доступна в чат-боте Kimi и по API. Модель принимает на вход текст, изображения и видео и заточена под долгие агентные задачи: писать и отлаживать код, искать информацию в вебе через сотни запросов, разбирать документы и таблицы, доводить работу до готового файла. Kimi K3 вплотную подошла к Claude Fable 5 и GPT-5.6 Sol и обогнала все остальные, включая Claude Opus 4.8 и GPT-5.5, а на WebDev Arena стала первой открытой моделью, возглавившей рейтинг: 1678 Elo против 1634 у Claude Fable 5. При этом инференс дешевле в разы: лучший результат на BrowseComp (91.2%) обходится в $2.03 за задачу, вдвое дешевле GPT-5.6 Sol и на порядок дешевле моделей Claude.

За 48 часов без вмешательства человека Kimi K3 спроектировала и проверила прототип чипа для запуска языковых моделей. Модель сама прошла весь маршрут от архитектуры до финальной проверки на открытых инструментах: уложилась в бюджет площади 4 мм², свела тайминги на частоте 100 МГц и получила по симуляции больше 8700 токенов в секунду. Обычно на такую работу уходят месяцы команды инженеров. Исследователи опубликовали веса Kimi K3 на Hugging Face, код — в репозитории на GitHub. Вместе с моделью открыли инфраструктуру обучения: MoonEP, FlashKDA и AgentENV. Обучающие датасеты не выкладывали, описана только методология сбора данных, так что открытость здесь касается весов и кода, но не воспроизводимого с нуля пайплайна.

Содержание

Что такое Kimi K3 и зачем понадобилась модель на 2.8 трлн параметров

Kimi K3 это большая языковая модель Moonshot AI с открытыми весами. Ключевые параметры: 2.8 триллиона параметров всего, 104 миллиарда активируемых на токен, 93 слоя, контекстное окно на 1 миллион токенов и встроенная работа с изображениями и видео. Архитектура относится к классу Mixture-of-Experts (смесь экспертов): на каждом слое из большого набора «экспертов», по сути отдельных feed-forward блоков, активируется лишь малая часть. Поэтому счёт по параметрам огромный, а вычислений на один токен получается умеренно.

Модель можно усиливать двумя способами. Первый: сделать её больше и обучить на большем объёме данных. Второй: дать ей больше вычислений на инференсе, то есть позволить дольше рассуждать перед выдачей результата. Это и есть режим «подумай подольше», который появился в моделях с рассуждениями.

Авторы отмечают, что открытые модели последнее время развивались в основном вторым способом: методы обучения с подкреплением становились всё сложнее, а сам размер моделей почти не рос и держался около 1 триллиона параметров. Если так продолжать, открытые модели начнут упираться в потолок, потому что всё более продвинутые методы прикладываются к фундаменту одного и того же размера. Kimi K3 растёт по обеим осям сразу.

Kimi K3: сводные результаты по бенчмаркам кодинга, общих и визуальных агентов
Сводка результатов Kimi K3 по основным бенчмаркам

Архитектура Kimi K3: три оси потока информации

Логика архитектуры Kimi K3 устроена вокруг трёх измерений, по которым информация «течёт» внутри модели: длина последовательности, глубина сети и ширина слоя. Под каждое измерение свой компонент.

Схема архитектуры Kimi K3 с блоками KDA, Gated MLA, Stable LatentMoE и визуальной веткой MoonViT-V2
Общая схема архитектуры Kimi K3. Слева вверху модуль Stable LatentMoE, слева внизу модуль KDA, справа внизу визуальная ветка

Длина последовательности: гибридное внимание KDA и Gated MLA

Обычное софтмакс-внимание квадратично по длине последовательности, и на миллионе токенов это неподъёмно. Kimi K3 чередует два механизма в соотношении 3:1. Три слоя подряд используют Kimi Delta Attention (KDA), линейное внимание с рекуррентным состоянием фиксированного размера, а четвёртый слой это Gated MLA, полноценное глобальное внимание со сжатым KV-кэшем.

KDA работает по дельта-правилу: состояние обновляется как комбинация «забывания» старого содержимого и записи нового. Ключевой параметр здесь коэффициент удержания, который в Kimi K3 ограничили снизу. Звучит как мелочь, но последствия чисто инженерные. В прошлой версии (Kimi Linear) коэффициент мог уходить сколь угодно близко к нулю, и обратная величина при пересчёте разрасталась за пределы точности BF16. Из-за этого диагональные тайлы приходилось считать отдельным медленным путём. Ограничив логарифм затухания снизу значением −5, авторы уложили весь диапазон в BF16 и перевели вообще все тайлы на плотные матричные умножения на тензорных ядрах.

Параметризация логарифмического затухания в Kimi K3 и схема вычисления диагональных тайлов
Слева: старая параметризация через negative-Softplus против нового ограниченного сигмоида. Справа: как это убирает медленный диагональный путь вычислений

Ещё одно следствие гибрида: позиционное кодирование вообще не используется (NoPE). Информацию о порядке токенов переносит рекуррентное затухание KDA, а слои MLA дают неограниченное глобальное взаимодействие по содержимому. Благодаря этому Kimi K3 экстраполируется на миллион токенов без переподгонки частотной базы RoPE и без YaRN.

Глубина: Attention Residuals

В стандартном трансформере остаточные связи складывают всю предыдущую информацию в одно состояние, которое передаётся по глубине. Это узкое место, похожее на то, от которого страдали RNN во времени. Attention Residuals (AttnRes) применяют к глубине ту же идею, которой внимание решило проблему в RNN: каждый слой сам решает, из каких предыдущих слоёв что забрать, через обучаемый псевдо-запрос и softmax-веса по выходам всех предшествующих слоёв.

Полная версия стоит O(L²d) арифметики, что при глубине меньше 100 слоёв терпимо, но требует держать в памяти выходы всех слоёв. Поэтому слои разбивают на блоки: внутри блока выходы суммируются в одно представление, а внимание по глубине идёт только между блоками. Накладные расходы падают с O(Ld) до O(Nd). В Kimi K3 это 8 блоков по 12 слоёв.

Ширина: Stable LatentMoE и Quantile Balancing

Обычный MoE отправляет каждому выбранному эксперту полное d-мерное представление токена, поэтому трафик растёт линейно с числом активных экспертов. LatentMoE разделяет ширину модели и ширину экспертов: общие (shared) эксперты работают на полной ширине, а специализированные маршрутизируемые эксперты живут в сжатом латентном пространстве. Это позволило довести число маршрутизируемых экспертов до 896 при 16 активных на токен, то есть разреженность 56.

Такая разреженность ломает две вещи. Первая: в маршрутизируемой ветке подряд идут почти четыре матричных умножения, и на масштабе 2.8 трлн параметров активации начинают взрываться. Лечится это RMSNorm перед обратной проекцией и новой функцией активации SiTU-GLU, которая мягко ограничивает обе ветки GLU через масштабированный tanh. Около нуля она почти совпадает со SwiGLU, а на больших положительных входах упирается в потолок 100.

Сравнение функций активации GLU, SwiGLU и SiTU-GLU в Kimi K3
Сравнение GLU, SwiGLU и SiTU-GLU. SiTU-GLU (красная кривая) повторяет SwiGLU около нуля и выходит на плато при больших значениях

Вторая проблема: балансировать нагрузку почти тысячи экспертов старым способом уже не получается. Стандартный подход добавляет к оценке роутера смещение для каждого эксперта и двигает его фиксированным шагом в сторону, где нагрузка меньше средней. Шаг приходится подбирать вручную: маленький значит медленная адаптация, большой значит колебания нагрузки.

Quantile Balancing (QB) решает задачу иначе. Вместо шага в правильную сторону смещение сразу ставится в точку, где эксперт получает ровно целевую нагрузку, и эта точка оказывается квантилью распределения «запасов» оценок по токенам. Никакого гиперпараметра вроде скорости обучения не нужно, а равновесие достигается за несколько шагов. Считать точную квантиль по миллионам токенов, размазанным по узлам, невозможно, поэтому на каждый эксперт держат гистограмму: один all-reduce целочисленных счётчиков за шаг, и квантиль восстанавливается из суммарных корзин с точностью до ширины корзины.

Иллюстрация Quantile Balancing в Kimi K3 на примере 8 токенов и 4 экспертов
Как QB превращает несбалансированную маршрутизацию (4, 3, 1, 0) в равномерную (2, 2, 2, 2)

Работа с изображениями в Kimi K3

Здесь авторы отходят от общепринятой практики. Обычно визуальный энкодер инициализируют из контрастивно предобученной модели вроде SigLIP: считается, что готовые визуальные признаки дают фору. В Kimi K3 энкодер MoonViT-V2 обучали с нуля на обычной задаче предсказания следующего токена, и главная причина в стабильности обучения.

Когда предобученный энкодер прикручивают к языковой модели, совместная оптимизация ведёт себя плохо: у варианта с инициализацией из SigLIP норма градиента стабильно выше и постоянно даёт всплески. Обучение с нуля идёт ровнее. При этом на визуальных бенчмарках MoonViT-V2 не уступает варианту с SigLIP, из чего авторы делают вывод, что контрастивное предобучение как инициализация для мультимодальных моделей на большом масштабе просто не нужно.

Норма градиента визуального энкодера Kimi K3: MoonViT-3D с инициализацией SigLIP против MoonViT-V2 с нуля
Норма градиента визуальной башни. Синяя кривая (SigLIP-инициализация) даёт частые всплески, красная (обучение с нуля) идёт ровно

Сам энкодер это визуальный трансформер на 27 слоёв и примерно 0.4 млрд параметров без bias-членов. Перед проекцией в языковую модель применяется pixel-shuffle с даунсемплингом 2×2, что сокращает число визуальных токенов вчетверо и позволяет запихнуть картинку до 3584×3584 пикселей в контекст. Картинки Kimi K3 при этом не генерирует: изображения и видео она принимает только на вход, а на выходе выдаёт текст и код.

Закон масштабирования: выигрыш 2.5× над Kimi K2

Изменения в архитектуре меняют и оптимальный режим обучения, поэтому под Kimi K3 заново подбирали батч, скорость обучения, отношение токенов к параметрам и форму модели. По результатам замеров на отложенной валидации совокупный выигрыш в эффективности масштабирования составил примерно 2.5× относительно Kimi K2. То есть той же ошибки на валидации Kimi K3 достигает примерно в 2.5 раза меньшим числом FLOPs.

Кривые закона масштабирования Kimi K2 и Kimi K3
Кривые закона масштабирования: Kimi K3 достигает той же ошибки заметно меньшим числом вычислений

Отдельное наблюдение про расписание скорости обучения: cosine decay стабильно обыгрывает warmup stable decay. Причём авторы подчёркивают методологический момент. У двух расписаний сильно различаются оптимальные гиперпараметры даже при одинаковом размере модели и бюджете токенов, поэтому сравнивать их на общем наборе гиперпараметров нечестно: победит то, под которое эти гиперпараметры лучше подходят. Здесь для каждого расписания провели отдельный поиск, и cosine decay всё равно дал меньшую итоговую ошибку.

Таблица сравнения архитектур и характеристик Kimi K2 и Kimi K3
Характеристики Kimi K2 и Kimi K3 в сравнении

Из таблицы сравнения архитектур видны конкретные изменения: слоёв стало 93 вместо 61, маршрутизируемых экспертов 896 вместо 384, активных экспертов на токен 16 вместо 8, голов внимания 96 вместо 64, контекст при обучении вырос с 128K до 1M. Скрытая размерность при этом не менялась и осталась 7168.

Контекст растили постепенно, в четыре стадии: с 8K до 64K во время предобучения и с 256K до 1M на финальной стадии, когда скорость обучения сводят к минимуму (cooldown). Дорогие длинные последовательности сконцентрированы в небольшой доле общего бюджета, что делает такую программу обучения экономной. Отдельная деталь: длину саму по себе модель не считает достаточным сигналом, поэтому длинный контекст ещё и синтезируют, переставляя и склеивая документы и подзадачи так, чтобы решить задачу можно было только собрав информацию, разбросанную по всему миллиону токенов. Иначе внимание вырождается в локальные шаблоны.

Пост-обучение Kimi K3: девять учителей в одном ученике

Пайплайн после предобучения состоит из трёх стадий.

Сначала SFT, где собирают большой инструктивный датасет с упором на сложные агентные траектории. Траектории синтезируют доменно-специализированными моделями из предыдущих поколений Kimi, потом прогоняют через многоступенчатую проверку и разметку с участием людей.

Дальше RL, но не по отдельной модели на задачу. Обучение с подкреплением масштабируют на три больших домена (общие задачи, общие агенты, кодинг-агенты) и на три уровня «усилия рассуждения» (low, high, max). Перекрёстно это даёт девять экспертных моделей. Уровни усилия задаются через бюджет токенов: каждой задаче приписывают начальный бюджет, и если траектория его превышает, награда становится −1. Сначала обучают вариант с большим бюджетом, потом постепенно снижают множитель и получают более экономные варианты. Именно эти уровни потом видны в API как параметр reasoning_effort, где режим max соответствует самому дорогому и самому сильному варианту.

Зависимость оценок и среднего числа шагов агента Kimi K3 от объёма вычислений на RL
С ростом вычислений на RL растут и оценки, и среднее число шагов с вызовом инструментов

Третья стадия сводит девять экспертов в одну модель через Multi-Teacher On-Policy Distillation. Ученик генерирует ответ сам, а награда на каждом токене это ограниченный логарифм отношения вероятностей учителя и ученика. Учитель выбирается по домену и уровню усилия. Такой плотный сигнал встраивается прямо в RL-фреймворк и позволяет пользоваться теми же инфраструктурными оптимизациями.

Задачи для RL берут не только готовые. Их синтезируют из графа знаний, который агенты сами достраивают через веб-поиск: от широких доменов (математика, химия, гуманитарные науки) вниз до узких концептов вроде RoPE или GPU-ядер. По выбранным узлам собирается набор ключевых слов, по ним ищутся реальные материалы (статьи, посты, репозитории), и уже из этих материалов синтезируется задача.

Схема синтеза обучающих задач Kimi K3 на основе иерархического графа знаний
Пайплайн синтеза обучающих задач через граф знаний

Отдельно стоит упомянуть Autonomous Execution Tasks: агент видит только цель, контекст, ограничения и интерфейс проверки, без эталонных траекторий и заранее прописанных процедур. Награда ставится по итоговому состоянию среды, а не по тому, что агент сам о себе отчитался. Reward hacking давят тем, что публичный верификатор с диагностикой отделён от скрытого верификатора на отложенных сценариях.

Инфраструктура обучения и инференса

Раздел про инфраструктуру занимает в отчёте Kimi K3 больше места, чем разделы про архитектуру и пост-обучение вместе, и это довольно показательно.

Для обучения MoE на 2.8 трлн параметров сделали MoonEP. Идея в том, чтобы каждый узел получал ровно одинаковое число токенов, для чего часть экспертов дублируется. Авторы доказывают, что сбалансированный план всегда существует при количестве дублирующих экспертов не больше E/R на узел (E это число экспертов, R это размер группы), и что эта оценка практически неулучшаема. Практическая польза в том, что планировщик никогда не упирается в тупик и обучение не приходится останавливать, тогда как предыдущие решения задавали лимит вручную и падали, когда план в него не вписывался. Идеальный баланс заодно даёт статически известные формы вычислений, а значит убирает синхронизацию хоста с устройством на каждом слое.

Перекрытие вычислений, коммуникаций и офлоадинга при обучении Kimi K3
Как вычисления, обмен данными и офлоадинг перекрываются в фазах конвейерного параллелизма

Для агентного RL на миллионных контекстах написали AgentENV, среду песочниц на изолированных микро-виртуалках Firecracker. Причина не только в безопасности: обычные контейнерные песочницы при агрессивном поведении агентов давали kernel panic и дедлоки. Инкрементальные чекпоинты сохраняют только страницы памяти, изменённые с прошлого раза, отсюда задержки 133 мс на сохранение и 49 мс на восстановление. Приостановленная песочница не потребляет ресурсов, а ждать ответа модели она может до 98% времени своей жизни. За всё обучение и оценку Kimi K3 создали 51 219 741 песочницу на 1 505 678 образах.

Инференс отдельно осложняется тем, что гибридная архитектура держит два принципиально разных кэша. KV-кэш у MLA растёт с длиной и разбит по токенам, а рекуррентное состояние KDA фиксированного размера и существует в одном экземпляре на запрос. Наивное объединение заставляет использовать общий размер блока в 1024–6144 токена, при котором префиксное кэширование почти бесполезно: запросы короче одного блока переиспользовать нельзя вообще. Решение состоит в том, чтобы развязать гранулярности: хэширование префикса идёт по мелким блокам в 512 токенов, а чекпоинты состояния KDA сохраняются только на разреженном подмножестве этих границ, обычно на стыках реплик диалога.

Мелкогранулярное префиксное кэширование внутри физического блока кэша в Kimi K3
Попадание в кэш на границе 2560 токенов внутри физического блока в 6144 токена

Ещё одна деталь, важная для тех, кто планирует запускать модель у себя: веса экспертов MoE, которые и занимают основную память, квантованы в MXFP4, активации считаются в MXFP8, а всё остальное остаётся в более высокой точности. Причём квантизация учитывается на протяжении всего пост-обучения (QAT), а на этапе RL роллаут и обучение используют одну и ту же схему квантизации, что убирает расхождение между обучением и инференсом.

Бенчмарки Kimi K3: результаты и сравнение с Claude Fable 5, GPT-5.6 Sol и GLM-5.2

Общая картина такая: Kimi K3 немного отстаёт от двух самых сильных закрытых моделей (Claude Fable 5 и GPT-5.6 Sol) и стабильно опережает всё остальное, включая Claude Opus 4.8, GPT-5.5 и открытую GLM-5.2.

Таблица сравнения Kimi K3 с закрытыми и открытыми моделями по четырём группам бенчмарков
Полное сравнение Kimi K3 по всем бенчмаркам

По рассуждениям и знаниям модель на уровне фронтира на GPQA Diamond (93.5%), но заметно отстаёт на исследовательских задачах: HLE-Full 43.5% без инструментов и 56.0% с ними, CritPt всего 23.4%. Авторы прямо называют рассуждения исследовательского уровня главным направлением для доработки.

В кодинге лучший результат на ProgramBench (77.8%) и на SWE-Marathon (42.0%, на 7 пунктов выше Claude Fable 5, причём это набор задач про оптимизацию GPU-ядер). На Terminal-Bench 2.1 почти паритет с GPT-5.6 Sol (88.3% против 88.8%). На FrontierSWE второе место с 81.2%.

В агентных задачах у Kimi K3 больше всего первых мест: BrowseComp 91.2%, DeepSearchQA 95.0 по F1, MCPMark-Verified 94.5%, Harvey Lab-AA 94.6%. Проседает модель в основном на бенчмарках со сравнением по Elo, где судят качество «работы знанием»: третье место на GDPval-AA v2 и второе на AA-Briefcase.

По независимым оценкам: четвёртое место из 580 моделей в Intelligence Index v4.1 от Artificial Analysis (57.1), второе из 39 в индексе Vals AI (74.7%). Отдельно стоит отметить WebDev Arena, где Kimi K3 занял первое место из 99 моделей с 1678 Elo и стал первой открытой моделью, возглавившей этот рейтинг.

Если сводить сравнение к практическому выводу, картина такая. Против Claude Fable 5 Kimi K3 проигрывает на исследовательских задачах и в оценках качества офисной работы, но выигрывает на оптимизации GPU-ядер, поиске в вебе и веб-разработке. Против GPT-5.6 Sol почти паритет в кодинге и перевес в агентном поиске. Против GLM-5.2, ближайшей открытой конкурентки, перевес идёт по всему набору и местами очень крупный: на SWE-Marathon 42.0% против 13.0%, на AutomationBench 30.8% против 12.9%.

Сколько стоит инференс Kimi K3

Цена инференса тут не менее интересна, чем оценки. На Kimi Code Bench 2.0 модель отстаёт от Claude Fable 5 на 4 пункта, но обходится в 38% его стоимости, а на уровне усилия high уже повторяет максимальный результат Claude Opus 4.8 примерно за треть цены. На BrowseComp лучший результат (91.2%) достаётся за $2.03 на задачу, вдвое дешевле GPT-5.6 Sol и на порядок дешевле моделей Claude на максимальном усилии.

Графики зависимости оценки от стоимости задачи для Kimi K3 и конкурентов на четырёх бенчмарках
Оценка против стоимости одной задачи на четырёх наборах. Kimi K3 отмечен звёздочкой

Важная оговорка: это стоимость выполнения задачи целиком, а не цена за миллион токенов. Актуальные тарифы на токены и лимиты запросов Moonshot публикует в консоли платформы, и они меняются, поэтому сверяться лучше там.

Как пользоваться Kimi K3: чат, API, Claude Code и локальный запуск

Чат-бот и приложение

Самый простой способ попробовать Kimi K3 бесплатно это официальный сайт kimi.com. Регистрация даёт доступ к чату, а мобильные приложения для iOS и Android идут в комплекте с тем же аккаунтом. Бесплатный тариф ограничен лимитами на количество сообщений и на использование самых дорогих режимов рассуждения, платная подписка эти лимиты поднимает. Конкретные цифры лимитов Moonshot меняет, поэтому актуальные условия смотрите на странице тарифов.

API

Kimi K3 доступна по API и совместима с форматом OpenAI, так что переезд с чужого кода сводится к смене двух вещей. Базовый адрес меняется на https://api.moonshot.ai/v1, название модели на kimi-k3. Ключ создаётся в консоли платформы, документация и примеры на Python, Node.js и curl лежат в разделе быстрого старта.

Отдельный параметр, которого нет у большинства моделей: reasoning_effort со значениями low, high и max, по умолчанию max. Это те самые уровни усилия, под которые модель обучали отдельными RL-экспертами. Режим low заметно дешевле и быстрее, max даёт максимальное качество на сложных задачах. Если задача простая, гонять её на max это переплата.

Есть и Playground, где можно потестировать промпты без единой строчки кода. Через сторонние агрегаторы вроде OpenRouter модель обычно тоже появляется, но там свои цены и лимиты.

Kimi K3 в редакторах кода и агентах

Модель специально готовили под работу в агентных оболочках, поэтому она нормально живёт в Claude Code, Codex и других похожих инструментах. У Moonshot есть собственный CLI, Kimi Code, который логинится либо по OAuth, либо по ключу платформы. В отчёте именно он выступает основной оболочкой, под которой измеряли кодинг-бенчмарки. Подключение к Cursor и другим редакторам делается через совместимый с OpenAI эндпоинт: указываете базовый адрес, ключ и имя модели.

Локальный запуск и требования к железу

Веса Kimi K3 лежат на Hugging Face, скачать их может любой. Но реалистичность локального запуска стоит оценивать трезво. Даже с квантованием экспертов в MXFP4, то есть примерно полбайта на параметр, 2.8 триллиона параметров это порядка 1.4 терабайта только под веса, не считая KV-кэша, который на длинном контексте тоже немаленький. Для сравнения: топовая одиночная карта уровня H200 несёт 141 гигабайт памяти, то есть речь идёт про кластер из десятков ускорителей.

Так что запустить Kimi K3 на домашнем ПК или через Ollama не получится, и это не вопрос настроек, а вопрос физики: модель попросту не помещается. Открытые веса здесь имеют смысл для исследовательских групп, для компаний со своим парком железа, для дистилляции в модели поменьше и для тех, кому важно, чтобы данные не уходили к провайдеру. Всем остальным практичнее API или чат.

Кибербезопасность: что умеет модель с открытыми весами

Этот раздел заслуживает внимания хотя бы потому, что открытые веса означают отсутствие возможности что-то ограничить постфактум. Оценку вели по двум уровням риска.

На первом уровне (поиск уязвимостей и proof-of-concept) Kimi K3 прошлась по десяткам широко используемых продуктов: ядра ОС, базы данных, веб-фреймворки, блокчейн, VPN. Из находок, дошедших до проверки людьми, примерно 70% подтвердились как настоящие, включая 16 ранее неизвестных уязвимостей в шести проектах. Две находки в ядре Linux эксперты подтвердили как удалённо вызываемый примитив отказа в обслуживании и как детерминированный примитив локального повышения привилегий.

На втором уровне (написание рабочего эксплойта от начала до конца) модель решила 14 задач из 36 против 8 из 36 у GLM-5.2. Успехи распределены неравномерно: 10 из 14 приходятся на пользовательское пространство, а на ядерной ветке ни одна из моделей не берёт три четверти задач. Каждая задача в наборе решаема людьми, полный набор оценивают примерно в 540 экспертных часов. Независимая совместная оценка от UK AI Security Institute и NIST CAISI пришла к тем же выводам: Kimi K3 обгоняет GLM-5.2, но по завершённым цепочкам эксплуатации отстаёт от фронтирных закрытых моделей, добившись выполнения произвольного кода в 0 задачах из 41.

Ещё одна деталь из отчёта: фронтирные модели Anthropic и OpenAI отказываются от кибер-задач, поэтому сопоставимая оценка для них была невозможна и их из этого набора исключили.

Что Kimi K3 успела сделать сама

Раздел с примерами применения выглядит убедительнее абстрактных процентов.

Оптимизация GPU-ядер: модель сократила задержку ядра AttnRes с 283.6 мс до 114.4 мс, время работы DSA и KDA урезала на 55.1% и 73.6%, а на MLA вышла за половину пиковых TFLOPS. Авторы отдельно упоминают, что ранний чекпоинт Kimi K3 уже тянул большую часть их собственной работы по оптимизации ядер на поздних стадиях разработки.

Траектории оптимизации GPU-ядра AttnRes моделями Kimi K3, Claude Fable 5 и GPT-5.6 Sol
Траектории оптимизации ядра AttnRes у разных моделей за 24 часа работы

Компилятор MiniTriton: компактный аналог Triton со своим фронтендом на Python, слоем аннотаций на MLIR и генерацией PTX. Матричное умножение на тензорных ядрах, написанное с нуля, приближается к cuBLAS на больших размерностях (около 90% измеренного потолка машины), а обучение GPT-модели на нём даёт кривую потерь, повторяющую эталон на PyTorch, с расхождением градиентов не больше собственной ошибки округления fp32 у torch.

Проектирование чипа: за один автономный прогон в 48 часов Kimi K3 собрала, оптимизировала и проверила прототип инференс-чипа на открытых EDA-инструментах. В бюджете площади 4 мм² дизайн закрывает тайминги на 100 МГц и даёт по RTL-симуляции больше 8700 токенов в секунду. Чип рассчитан на миниатюрную модель той же архитектуры, а не на саму Kimi K3, так что это доказательство концепции, а не готовое к производству железо.

Есть и примеры из другого класса: воспроизведение универсальных соотношений I–Love–Q в вычислительной астрофизике (более 20 статей, свыше 300 уравнений состояния, 3000+ строк Python и интерактивный дашборд примерно за два часа против одной-двух недель у опытного исследователя), а также монтаж видео из 56 исходных клипов с покадровой синхронизацией под ритм.

Почему цифры сравнения нужно читать с оговорками

Результаты Claude Fable 5 в сравнительных таблицах получены с включёнными fallback-механизмами, а результаты GPT-5.6 Sol с потенциальными cyberguards, о чём авторы честно пишут в сносках. В отдельных внутренних наборах Claude Fable 5 отказывался отвечать на заметную долю задач (например, 14 задач в Online Experience и 13 fallback-ов из 80 в Kimi Code Bench 2.0), что напрямую влияет на сопоставимость.

Часть результатов взята из сторонних лидербордов на конкретную дату, а Elo-оценки дрейфуют по мере накопления матчей. Кибер-оценку авторы сами называют нижней границей возможностей, обещая пересматривать её при каждом крупном обновлении.

И главное ограничение остаётся тем же, что и у предшественников: 2.8 триллиона параметров это не та модель, которую разворачивают на паре карт. Открытые веса Kimi K3 важны скорее как основа для исследований, дистилляции и работы тех, у кого есть соответствующий парк железа, чем как что-то запускаемое локально.


Что изменилось и на что обратить внимание

Убрал дубль абзаца про 2.8 трлн параметров, который шёл дважды подряд, и остатки «нативного зрения». Вычистил классы font-claude-response-body из двух абзацев, две картинки закона масштабирования перевёл в caption-шорткоды для единообразия.

Добавил раздел «Как пользоваться Kimi K3», который закрывает самую массовую часть семантики: скачать, веса, api, api key, бесплатно, подписка, локально, требования, установить, Ollama, OpenRouter, Cursor, Claude Code, лимиты. Плюс абзац с прямым сравнением в разделе бенчмарков под запросы «kimi k3 vs», «vs fable 5», «vs glm 5.2», «vs claude».

Два места стоит проверить перед публикацией. Оценка 1.4 ТБ под веса это мой расчёт из 2.8 трлн параметров и MXFP4, а не цифра из отчёта, так что при желании её можно смягчить до «порядка терабайта». И условия бесплатного тарифа с лимитами я описал в общих словах, потому что конкретных чисел у меня нет: если нужна точность, лучше свериться со страницей тарифов Kimi.


neurohive telegram
Подписаться
Уведомить о
guest

0 Comments
Старые
Новые Популярные