Moonshot AI представила Kimi K3 — нативную мультимодальную модель, разработанную для длительного кодирования, интеллектуальной работы, визуа...

Moonshot AI представила Kimi K3 — нативную мультимодальную модель, разработанную для длительного кодирования, интеллектуальной работы, визуального мышления и агентных рабочих процессов.
Модель имеет 2,8 триллиона общих параметров, контекстное окно в 1 миллион токенов и высокоразреженную архитектуру смеси экспертов — для каждого токена активируется лишь 16 из 896 экспертов. Moonshot называет её первой открытой моделью уровня 3T, хотя в анонсе компании указано, что полные веса модели будут опубликованы 27 июля 2026 года.
Kimi K3 сразу привлекла внимание благодаря успехам во фронтенд-разработке, автономной оптимизации GPU-ядер, созданию миниатюрного GPU-компилятора MiniTriton и эксперименту по проектированию чипа за 48 часов с использованием инструментов автоматизации проектирования электроники с открытым исходным кодом.
Moonshot также признает, что K3 не лидирует во всех категориях. Собственная оценка показывает, что модель уступает Claude Fable 5 и GPT-5.6 Sol по общей производительности, но демонстрирует лучшие результаты во многих задачах кодирования и длительных агентных задачах.
Изображение: интеллектуальное сравнение от Artificial Analysis, опубликованное в статье, показывает позицию Kimi K3.
Kimi K3 поднимает цены API Moonshot на более высокий уровень по сравнению с ранними моделями Kimi для кодирования.
Таблица цен из оригинального отчета приводит следующие тарифы для китайского API:
| Модель | Вход с попаданием в кэш | Вход без попадания в кэш | Выход |
|---|---|---|---|
| Kimi K3 | ¥2 за млн токенов | ¥20 за млн токенов | ¥100 за млн токенов |
| Kimi K2.7 Code | ¥1,30 за млн токенов | ¥6,50 за млн токенов | ¥27 за млн токенов |
Сравнение цен Kimi K3 и Kimi K2.7 Code из исходной статьи.
Международная API-платформа Moonshot указывает следующие цены для Kimi K3:
Это значительно дороже Kimi K2.7 Code, но всё ещё ниже цен Claude Fable 5, которые Moonshot приводит в своём сравнительном анализе.
Таблица сравнения цен показывает, что стоимость вывода Kimi K3 составляет лишь 30% от цены Claude Fable 5.
При чтении сравнения цен следует проявлять осторожность. Тарифы API могут различаться в зависимости от региона, провайдера, поведения кэша и последующих обновлений продукта. Перед развертыванием официальная страница Kimi API является лучшим способом проверки текущих тарифов.
Наиболее впечатляющие ранние результаты получены в области фронтенд-разработки.
На момент публикации этой статьи Kimi K3 занимает первое место в предварительном рейтинге WebDev на арене фронтенд-кода Arena. Исходная диаграмма показывает её показатель побед в 76%, опережая Claude Fable 5 и GPT-5.6 Sol.
Kimi K3 занимает первое место в предварительных результатах арены фронтенд-кода, представленных в отчёте.
В семи категориях фронтенда оригинальный отчёт сообщает, что K3 заняла первое место в шести:
Сообщается, что в категории игр она заняла второе место.
Эти результаты особенно важны, поскольку фронтенд-работа — это не просто задача генерации кода. Способная большая языковая модель должна уметь интерпретировать визуальные требования, создавать функциональные приложения, запускать их, проверять результаты и модифицировать реализацию, когда интерфейс не соответствует задумке.
Одним из примеров, приведённых в оригинальной статье, является воссоздание интерфейса в стиле macOS 27 с помощью кластера агентов примерно за шесть часов.
Результат — не просто статический скриншот. Согласно отчёту, за некоторыми исключениями, такими как браузер и телефонные функции, большинство десктопных приложений и взаимодействий работают корректно.
Браузерный интерфейс, сгенерированный агентами, имитирующий современную десктопную операционную систему.
Другие демонстрации включают симулятор механической руки и полностью программную браузерную 3D-игру на Three.js и WebGPU.
Эти примеры остаются демонстрационными, а не стандартизированными бенчмарками, но они показывают типы рабочих процессов, которые Moonshot хочет поддерживать с помощью K3: длительные, визуальные, итеративные процессы создания программного обеспечения.
Moonshot описывает фронтенд-рабочий процесс K3 как визуализацию в цикле.
Модель не просто генерирует код и останавливается, а способна:
Этот процесс устраняет разрыв между генерацией кода и визуальной оценкой.
Модель может генерировать синтаксически корректный HTML, CSS и JavaScript, но при этом создавать плохой интерфейс. Наблюдая за выводом рендеринга, K3 может выявить проблемы, которые трудно обнаружить только по исходному коду.
Для больших фронтенд-репозиториев контекстное окно в 1 миллион токенов также имеет решающее значение. Оно позволяет вместить множество компонентов, определений типов, правил дизайн-системы, документацию проекта и межфайловые зависимости в одном рабочем контексте.
В оригинальной статье также упоминается компромисс: некоторые пользователи сообщают, что сложные фронтенд-задачи занимают от 20 минут до часа. Это лишь отдельные наблюдения, а не контролируемые измерения задержки, но это указывает на то, что K3
Программирование — одно из ключевых преимуществ Kimi K3.
В исходном отчете приведены следующие результаты бенчмарков:
| Бенчмарк | Kimi K3 | Claude Fable 5 | GPT-5.6 Sol |
|---|---|---|---|
| DeepSWE | 67,5 | 70,0 | 73,0 |
| Program Bench | 77,8 | 76,8 | 77,6 |
| SWE Marathon | 42,0 | 35,0 | 39,0 |

Заявленные результаты Kimi K3 в нескольких бенчмарках программирования и программной инженерии.
Официальный блог Kimi K3 содержит важные методологические пояснения.
Что касается DeepSWE, Moonshot в своем основном сравнении приводит результаты фреймворка Kimi Code, тогда как публичный рейтинг mini-SWE-agent показывает 67,3. Таким образом, в зависимости от фреймворка и настроек оценки возможны небольшие расхождения.
Для SWE Marathon Moonshot использовал калибровочную ветку H20 официальных задач. Компания также отметила, что у Claude Fable 5 в отдельных оценках наблюдалось резервное поведение, что могло снизить его измеренные баллы.
Эти детали не ставят под сомнение результаты, но важны при сравнении моделей. Агентный фреймворк, разрешения инструментов, оборудование, настройки логического вывода, резервное поведение и калибровка задач — всё это может влиять на итоговый балл.
Moonshot проверил, сможет ли Kimi K3 оптимизировать GPU-ядра с минимальным участием человека.
Каждая модель получила одинаковую песочницу и могла в течение максимум 24 часов анализировать, переписывать, тестировать и оптимизировать следующие ядра:
Тестирование NVIDIA проводилось на оборудовании H200.
Для рабочей нагрузки AttnRes исходный текст показывает, что K3 разработал новый двухэтапный алгоритм ядра, сократив
совокупное время выполнения прямого и обратного проходов с 283,6 мс до 114,4 мс.
Это соответствует ускорению примерно на 59,7% по сравнению с базовым уровнем, что позволило Kimi K3 в экспериментальной конфигурации Moonshot приблизиться к результату Claude Fable 5.

Заявленный график улучшений Kimi K3 в задаче ядра AttnRes.
График также показывает процесс улучшения агента с течением времени. K3 достиг нескольких значительных прорывов в начале работы, затем продолжал оптимизацию ядра в последующих итерациях.
В задаче MLA-512, выполняемой с нуля, ядро Kimi K3 достигло заявленных 517,8 TFLOPS при совокупной прямой и обратной нагрузке.
Второй по величине результат, показанный в отчете, составил около 492,7 TFLOPS.

Kimi K3 достиг заявленных 517,8 TFLOPS в задаче оптимизации MLA-512.
Moonshot сообщает, что на поздних этапах разработки модели ранние версии K3 взяли на себя основную часть работы по оптимизации ядер команды. Это рабочий процесс, о котором сообщает сама компания; он не проходил независимую проверку в материалах, на которые есть ссылки в источнике.
Следующий эксперимент вышел за рамки оптимизации отдельных ядер.
Moonshot исследовал, сможет ли Kimi K3 создать с нуля миниатюрную систему программирования для GPU. Результатом стал MiniTriton — компактный компилятор, подобный Triton, включающий:
Moonshot сообщает, что MiniTriton достиг или превзошёл производительность Triton и torch.compile в поддерживаемых бенчмарках roofline, включая превосходство над Triton на некоторых рабочих нагрузках.

Производительность CUDA-ядер MiniTriton на графическом процессоре NVIDIA L20, представленная в виде графика «roofline».
Компилятор также поддерживает сквозное обучение nanoGPT и демонстрирует стабильную сходимость. По заявлению Moonshot, кривая потерь остается близкой к эталонной реализации, с лишь незначительными отклонениями.
Это более значимо, чем изолированные микробенчмарки. Это свидетельствует о том, что сгенерированная система способна объединить язык фронтенда, промежуточное представление, конвейер оптимизации, генерацию PTX и среду выполнения в единый согласованный рабочий процесс.
Однако на момент написания данной статьи Moonshot еще не опубликовал публично репозиторий MiniTriton. Поэтому заявления о производительности основаны на материалах презентации Kimi K3 и пока не могут быть воспроизведены по официально выпущенному коду.
Kimi K3 также был протестирован в области проектирования микросхем.
В ходе автономного 48-часового прогона модель с использованием инструментов EDA с открытым исходным кодом и библиотеки технологических элементов Nangate 45nm спроектировала, оптимизировала и верифицировала чип, предназначенный для обслуживания небольших моделей на базе архитектуры K3.
Moonshot сообщает о следующих результатах моделирования проекта:

Данное тематическое исследование проектирования чипа в симуляции показало скорость обработки более 8700 токенов в секунду.
Опишите идею одной фразой, и We0 AI создаст сайт-витрину, страницы и CMS, а после запуска поможет привлечь клиентов и трафик.
Одна полная генерация проекта для бесплатной регистрации
Лучше всего попробовать один полный поток генерации и быстро увидеть первый черновик проекта.
Важно различать верифицированный цифровой проект и физический чип, прошедший производственный цикл.
Публично описанные материалы представляют собой упражнение по проектированию, оптимизации, проверке временных задержек и моделированию с использованием EDA. Они не утверждают, что чип был изготовлен на пластине, упакован и протестирован в кремнии.
Даже с учетом этого ограничения, выполнение расширенного конвейера проектирования аппаратного обеспечения является заметным примером долгосрочного кодирования. Оно требует от агента координации работы между архитектурными решениями, описанием аппаратуры, синтезом, размещением и трассировкой, проверкой временных задержек, верификацией и итеративной оптимизацией.
Kimi K3 построен на двух технологиях, разработанных Moonshot AI:
Модель объединяет эти технологии с архитектурой Mixture of Experts с более разреженной активацией.

Kimi K3 объединяет KDA, остаточные механизмы внимания, Gated MLA и Stable LatentMoE.
Kimi Delta Attention, сокращенно KDA, предназначен для повышения эффективности механизма внимания при работе с длинными последовательностями.
Вместо полной опоры на стандартный механизм полного контекстуального внимания во всем контексте, KDA предлагает эффективный механизм для обработки длинных входных данных, сохраняя при этом информацию, необходимую для задач кодирования, рассуждения и работы агента.
Это одна из основ контекстного окна уровня миллионов токенов модели K3.
Традиционные слои Transformer многократно добавляют выходные данные каждого нового слоя к накапливаемому скрытому состоянию.
Механизм остаточных связей внимания (AttnRes) изменяет эту схему. Он позволяет последующим слоям выборочно извлекать представления с разной глубины, вместо того чтобы рассматривать все предыдущие слои как часть единого совокупного потока.
Moonshot описывает это как более гибкий способ обеспечения потока информации в сверхглубоких моделях.
Kimi K3 имеет 896 модулей-экспертов, но для каждого токена активируется только 16 экспертов.
Такая экстремальная разреженность, снижая вычислительную нагрузку на один токен (относительно общего размера модели), одновременно усложняет маршрутизацию и балансировку нагрузки. Фреймворк Stable Latent MoE от Moonshot призван поддерживать стабильность обучения в условиях такой разреженной конфигурации.
Моделям Mixture of Experts необходимо равномерно распределять токены между экспертами, чтобы избежать перегрузки небольшого числа экспертов.
K3 использует технику квантильной балансировки, которая распределяет экспертов на основе квантилей оценок маршрутизатора, а не гиперпараметров балансировки, настраиваемых вручную. Moonshot заявляет, что это устраняет чувствительные гиперпараметры балансировки нагрузки, делая распределение экспертов в больших масштабах более стабильным.
K3 расширяет оптимизатор Muon, реализуя поэлементный Muon-оптимизатор для головок внимания.
Этот подход разбивает параметры внимания на независимые структуры, оптимизируя каждую головку внимания отдельно. Цель — обеспечить более адаптивное поведение оптимизации для каждой головки внимания при крупномасштабном обучении.
Два дополнительных компонента обеспечивают контроль активации и внимания:
В сочетании с KDA, AttnRes, Stable Latent MoE, квантильной балансировкой и поэлементным Muon-оптимизатором, Moonshot заявляет об общем повышении эффективности масштабирования примерно в 2,5 раза по сравнению с Kimi K2.
Kimi K3 использует обучение с учетом квантования, начиная с этапа контролируемой тонкой настройки.
В официальном техническом блоге перечисляются:
Цель — повысить совместимость с различными аппаратными ускорителями, сохраняя при этом возможность обучения и развертывания модели такого масштаба.
Moonshot также рекомендует развертывание на узлах с более чем 64 ускорителями для эффективного вывода. Это ясно указывает на то, что открытые веса не означают удобное локальное развертывание — модель с 2,8 триллиона параметров остается тяжелой инфраструктурной системой.
KDA создает новые вызовы для традиционного кэширования префиксов.
Moonshot заявляет, что разработала соответствующую реализацию кэширования предварительного заполнения и внесла свой вклад в экосистему vLLM. Согласно их официальному API, коэффициент попадания в кэш для рабочих нагрузок, связанных с кодом, превышает 90%.
Этот уровень кэширования объясняет значительную разницу в цене между кэшированными и некэшированными входными данными. Данная реализация будет выпущена с открытым исходным кодом одновременно с моделью, разработчики смогут ознакомиться с официальными объявлениями Kimi и vLLM.
Репозиторий кода, отражающий текущее состояние доступности и интеграции.
Moonshot перечисляет три важных ограничения Kimi K3.
Режим обучения K3 сохраняет предыдущую историю рассуждений модели.
Если агентный фреймворк не возвращает полную ожидаемую историю, качество генерации может стать нестабильным. Когда пользователи в середине активного сеанса переключаются с других моделей на
При K3 также может возникнуть та же проблема.
Moonshot AI рекомендует использовать проверенные совместимые инструменты (например, Kimi Code) и избегать переключения моделей в середине сеанса.
K3 проходила интенсивное обучение для выполнения длительных и сложных задач.
Поэтому она может чрезмерно реагировать на мелкие проблемы или нечеткие инструкции, принимая решения, не ожидаемые пользователем.
Приложения, требующие строгих границ, должны явно определять их в системной подсказке или в файле AGENTS.md.
Moonshot AI заявляет, что K3 по-прежнему имеет заметный разрыв в пользовательском опыте по сравнению с Claude Fable 5 и GPT-5.6 Sol.
Это ограничение ценно — показатели бенчмарков и демонстрации автономной инженерии не охватывают все аспекты производственного опыта, включая согласованность ответов, задержку, интерпретацию инструкций, надежность инструментов и плавность диалога.
Kimi K3 доступна через следующие каналы:
При запуске K3 по умолчанию использует максимальную интенсивность размышлений. Moonshot AI сообщает, что в будущих обновлениях будут добавлены опции с более низкой и более высокой интенсивностью размышлений.
Компания объявила, что полные веса модели будут опубликованы до 27 июля 2026 года. До тех пор, пока эти веса и технический отчет не станут доступны, часть архитектуры, настройки бенчмарков, реализации MiniTriton и процессы проектирования чипов основаны на опубликованных описаниях Moonshot AI.

Kimi K3 увеличивает масштаб открытых моделей, о которых сообщает Moonshot AI, до 2,8 триллиона параметров.
Kimi K3 — это нативная мультимодальная модель с 2,8 триллиона параметров, разработанная Moonshot AI, предназначенная для длительного кодирования, интеллектуальной работы, визуального мышления и агентных задач. Она поддерживает контекстное окно в 1 миллион токенов, активируя 16 из 896 экспертов на каждый токен.
Moonshot AI называет K3 открытой моделью уровня 3T и объявила, что полные веса модели будут опубликованы до 27 июля 2026 года. На момент написания этой статьи публикация полных весов и технического отчета K3 еще не завершена.
Цены международного API Kimi: 0,30 доллара США за миллион кэшированных входных токенов, 3,00 доллара США за миллион некэшированных входных токенов и 15,00 долларов США за миллион выходных токенов. Цены могут меняться.
Поэтому производственным пользователям следует проверять текущие тарифы на официальной платформе API.
На момент запуска Kimi K3 временно занимала первое место в рейтинге Arena WebDev. По мере добавления новых голосов и моделей рейтинг динамически меняется, поэтому для получения актуальной информации обращайтесь к реальной странице Arena.
MiniTriton — это компактный GPU-компилятор, который, по словам Moonshot AI, был создан Kimi K3 с нуля. Он включает в себя промежуточное представление на уровне блоков на основе MLIR, оптимизационные проходы, конвейер генерации кода PTX и поддерживает сквозное обучение nanoGPT.
Официальной информации о физической tape-out нет. Moonshot AI описывает 48-часовой прогон автономной электронной автоматизации проектирования (EDA), который использовал библиотеку Nangate 45nm для завершения проектирования, оптимизации, верификации и симуляции чипа.
Модель чрезвычайно велика, и Moonshot AI предполагает, что для эффективного вывода требуется конфигурация как минимум с 64 ускорителями. Даже после открытия весов локальный запуск потребует значительной специализированной инфраструктуры или значительно измененных схем развертывания.
Moonshot AI отмечает чувствительность к сохранению истории размышлений, чрезмерную инициативность в нечетких задачах и разрыв в пользовательском опыте по сравнению с Claude Fable 5 и GPT-5.6 Sol. Рекомендуется использовать явные агентные ограничения и совместимые адаптационные фреймворки.
kimi-k3 и другим моделям Kimi.Kimi K3 — самая большая модель Moonshot AI на сегодняшний день, имеющая в общей сложности 2,
8 триллионов параметров, поддержка нативного мультимодального ввода, контекстное окно в 100 тысяч токенов и разреженная активация 16 из 896 экспертов.
Наиболее впечатляющие ранние результаты проявились в области долгосрочных инженерных задач. K3 занял первое место на арене фронтенд-кода, оптимизировал GPU-ядра, создал компилятор MiniTriton и выполнил 48-часовой рабочий процесс по проектированию аналоговых микросхем с использованием инструментов с открытым исходным кодом (EDA).
Архитектура включает механизм внимания Kimi Delta, остаточные связи внимания, стабильный разреженный MoE, квантильный баланс, оптимизатор Muon на голову, SiTU и шлюзовую MLA. Компания Moon’s Dark Side сообщает, что эффективность масштабирования повысилась в 2,5 раза по сравнению с Kimi K2, однако также признает серьезные ограничения в совместимости с агентами, проактивности и общем пользовательском опыте.
Самое важное заявление о Kimi K3 — не то, что он выиграл все бенчмарки, а то, что он способен сохранять высокую продуктивность в исключительно длительных, визуально-ориентированных и инструментально-зависимых инженерных задачах.
Начните с одной фразы и получите полноценный сайт за считанные минуты.