Cerebras Systems совершает прорыв в мире ИИ: самый крупный триллионно-параметрический ИИ-модель работает на рекордной скорости
Менее чем через неделю после крупнейшего технологического IPO 2026 года, компания Cerebras Systems делает свой самый решительный шаг к доминированию на быстрорастущем рынке инференции (вывода) искусственного интеллекта. В понедельник производитель чипов из Саннивейла объявил о запуске Kimi K2.6 – открытой модели с триллионом параметров, разработанной пекинской компанией Moonshot AI, – для корпоративных клиентов со скоростью почти 1000 токенов в секунду. Эта скорость значительно превосходит показатели любых поставщиков на базе графических процессоров (GPU).
Содержание
- 1 Феноменальная производительность подтверждена
- 2 Почему китайская модель стала флагманом Cerebras
- 3 Как чипы масштаба кремниевой пластины решают проблему скорости для триллионно-параметрических моделей
- 4 Крупнейшие компании тестируют инференцию Cerebras
- 5 Конкурентная угроза от Nvidia и приобретения Groq за 20 миллиардов долларов
- 6 План Cerebras: обслуживать самые умные ИИ-модели быстрее всех
Феноменальная производительность подтверждена
Результат, который был независимо подтвержден аналитической фирмой Artificial Analysis, показал 981 выходной токен в секунду. Это делает Cerebras в 6,7 раза быстрее, чем следующий по скорости облачный провайдер на базе GPU, и в 23 раза быстрее среднего показателя. Для стандартного запроса на кодирование агентом, включающего 10 000 входных токенов, Cerebras предоставила полный ответ – включая обработку запроса, рассуждения и 500 выходных токенов – за 5,6 секунды. Для сравнения, официальная конечная точка Kimi выполнила ту же задачу за 163,7 секунды. Это означает 29-кратное сокращение времени до получения окончательного ответа.
«Мы хотим предельно ясно продемонстрировать, что можем работать с крупнейшими моделями», — заявил Джеймс Ван, директор по продуктовому маркетингу Cerebras, в эксклюзивном интервью VentureBeat перед объявлением. «В данном случае это Kimi K2.6 – триллионно-параметрическая MoE-модель (Mixture-of-Experts, модель со смешанными экспертами) на архитектуре масштаба кремниевой пластины, которая работает с той же невероятной скоростью, которой мы славимся».
Это объявление знаменует собой критический переломный момент для Cerebras, которая долго боролась с мнением, что ее неортодоксальные чипы масштаба кремниевой пластины, хотя и были невероятно быстрыми, могли обрабатывать только малые и средние модели. Kimi K2.6 является первой открытой моделью с триллионом параметров, которую компания запустила в производственную эксплуатацию. С рыночной капитализацией в 95 миллиардов долларов США и 5,55 миллиарда долларов США от IPO, Cerebras демонстрирует Уолл-стрит свое намерение конкурировать не только в скорости, но и в масштабе моделей.
Почему китайская модель стала флагманом Cerebras
Выбор Kimi K2.6 отражает как техническую веху, так и коммерческий расчет. Выпущенная 20 апреля компанией Moonshot AI – пекинской компанией, основанной в 2023 году выпускниками Университета Цинхуа и известной как одна из «AI-тигров» Китая, – K2.6 представляет собой MoE-модель с триллионом параметров. Она быстро зарекомендовала себя как самая мощная открытая модель для кодирования и агентных задач. Модель возглавляет рейтинг SWE-Bench Pro с результатом 58,6, превосходя Claude Opus 4.6 и соответствуя GPT-5.4, при этом демонстрируя лидирующие показатели в агентных бенчмарках, таких как Humanity's Last Exam и DeepSearchQA. Ее архитектура использует 32 миллиарда активированных параметров на токен из общего триллиона, с 384 экспертами, из которых 8 выбираются плюс 1 общий за один проход вперед, работая с контекстным окном в 256 000 токенов.
На практике K2.6 является одной из первых открытых моделей, которую предприятия могут использовать как полноценную замену дорогостоящим, ограниченным по пропускной способности закрытым API от Anthropic и OpenAI*, особенно для рабочих нагрузок, связанных с кодированием и агентным взаимодействием, которые стали наиболее ценным применением больших языковых моделей. Выпуск версии 2.6 расширяет возможности K2.6 от фронтенд-дизайна до полноценных фулстек-процессов, включая аутентификацию, операции с базами данных и выполнение долгосрочных агентных задач.
Джеймс Ван прямо высказался о причинах интереса предприятий. По его словам, они очень мотивированы получить альтернативу Anthropic. Модели Anthropic превосходны, но они довольно дороги и постоянно испытывают нехватку мощностей. Ван привел пример, когда приложение, работавшее через API Anthropic, вышло из строя на выходных из-за нехватки ресурсов – этот случай, по его мнению, находит глубокий отклик у корпоративных покупателей.
Тем не менее, стоит отметить геополитический аспект этого соглашения. Kimi K2.6 – модель, разработанная в Китае, которая предоставляется американским производителем чипов американским корпоративным клиентам. Moonshot AI работает из Пекина, и принятие K2.6 на Западе происходит в период усиленного контроля над китайскими ИИ-компаниями на рынке США. Корпоративным покупателям со строгими требованиями к соответствию нормативным актам – особенно в сфере финансовых услуг, здравоохранения и обороны – потребуется оценивать этот аспект наряду с техническими возможностями модели.
Как чипы масштаба кремниевой пластины решают проблему скорости для триллионно-параметрических моделей
Чтобы понять, почему Cerebras может достигать таких скоростей, необходимо осознать, чем ее аппаратное обеспечение принципиально отличается от всего остального на рынке. Большая часть инференции ИИ сегодня работает на кластерах GPU Nvidia – обычно это стойки из 72 графических процессоров, которые Nvidia продает как конфигурацию NVL72. В таких установках параметры модели распределены по множеству дискретных чипов, соединенных высокоскоростной сетевой тканью. Данные должны постоянно перемещаться между чипами, и пропускная способность межсоединений между GPU становится узким местом, особенно для больших моделей с сотнями миллиардов или триллионами параметров.
Cerebras использует радикально иной подход. Ее Wafer-Scale Engine 3 (WSE3) – это единый чип размером со всю кремниевую пластину, примерно с тарелку для обеда, содержащий 44 гигабайта встроенной статической оперативной памяти (SRAM). В отличие от высокоскоростной памяти, используемой в GPU, SRAM находится непосредственно на кристалле процессора, предлагая значительно более низкую задержку и более высокую пропускную способность для доступа к данным. Для Kimi K2.6 Cerebras хранит веса модели в исходной 4-битной точности, выполняя вычисления с 16-битной плавающей запятой. Веса распределены по нескольким пластинам в кластере из примерно 20 систем CS-3, а активации передаются между ними потоками. Критически важно, что все эксперты для данного MoE-слоя размещаются на одной и той же пластине, что означает, что широковещательная связь, необходимая для маршрутизации экспертов, происходит на скоростях SRAM. Согласно техническому описанию Cerebras, встроенная в пластину сетевая ткань обеспечивает более чем 200-кратную пропускную способность по сравнению с NVLink на NVL72.
Джеймс Ван объяснил архитектуру, используя аналогию: «Наши отдельные модули намного больше и имеют гораздо большую емкость – они сопоставимы с 20 стойками, в отличие от 72 графических процессоров». По его словам, каждый слой в трансформере может одновременно обслуживать отдельного пользователя. Они работают как очередь, где каждый пользователь занимает отдельную часть аппаратного обеспечения. Но поскольку данные перемещаются так быстро, фактический опыт, количество токенов в секунду для одного пользователя, на стороне клиента остается привычным. В сочетании с кастомными ядрами и спекулятивным декодированием это позволяет Cerebras обслуживать триллионно-параметрическую MoE-модель со скоростью около 1000 токенов в секунду – скорость, которую компания называет мировым рекордом, достижимым только с аппаратным обеспечением масштаба кремниевой пластины.
Крупнейшие компании тестируют инференцию Cerebras
Cerebras не открывает K2.6 для широкой публики. Вместо этого компания позиционирует это как предложение, ориентированное на корпоративный сегмент. Компании из списка Fortune 500 в сферах программного обеспечения, финансовых услуг и здравоохранения в настоящее время проводят облачные испытания своих производственных рабочих нагрузок на этой платформе. По словам Джеймса Вана, это известные бренды, хотя он отказался назвать конкретных клиентов из-за соглашений о конфиденциальности.
Подход «сначала предприятия» является преднамеренным. Cerebras исторически отдавала приоритет своим крупнейшим клиентам перед потребительскими API, отчасти из-за ограничений аппаратных мощностей. Как объяснил Ван, все сталкиваются с нехваткой мощностей. Cerebras отдает приоритет своим корпоративным клиентам, поэтому не предлагает решение через потребительский шлюз или API, где трафик очень непредсказуем, и один пользователь может фактически занять весь кластер. Обслуживание K2.6 также ограничивает возможность компании одновременно предлагать другие крупные модели. Ван признал, что они не могут одновременно поддерживать еще шесть моделей, что является «взаимным ограничением реальности».
Что касается ценообразования, Ван отметил, что хотя для корпоративных развертываний публичных цен нет, затраты компании в целом конкурентоспособны с провайдерами на базе GPU. По его словам, для всех моделей, для которых установлены цены, ценообразование очень сопоставимо – возможно, находится в среднем или средне-высоком диапазоне цен на GPU. Это не тот случай, когда быстрая работа означает многократно большую стоимость. Однако он провел черту на самом низком ценовом сегменте рынка: если компания готова запускать K2.6 со скоростью 20 токенов в секунду на бюджетной инфраструктуре GPU, Cerebras не будет пытаться конкурировать по цене. «Мы автопроизводитель на рынке пикапов. Мы не занимаемся тем рынком», — заявил Ван. Для рабочих нагрузок, критичных к скорости – в частности, для агентного кодирования, где разработчики в реальном времени ожидают генерации и итерации кода моделью – ценностное предложение просто: сопоставимая стоимость за токен, но на порядок более быстрая доставка.
Конкурентная угроза от Nvidia и приобретения Groq за 20 миллиардов долларов
Объявление Cerebras происходит в поворотный момент для индустрии чипов ИИ, когда рынок инференции быстро обгоняет рынок обучения как наиболее коммерчески важную вычислительную рабочую нагрузку. По мере распространения ИИ-агентов в корпоративном программном обеспечении, скорость инференции напрямую определяет полезность этих агентов на практике, и конкурентное давление соответственно усиливается.
Наиболее значимым конкурентным событием последних месяцев стало приобретение Nvidia компании Groq за 20 миллиардов долларов США. Эта сделка предоставила гиганту GPU доступ к проприетарной технологии инференции, построенной вокруг специализированных языковых процессоров (LPU). Джеймс Ван прямо упомянул эту сделку: «Nvidia теперь чувствует, что быстрая инференция – чрезвычайно важный рынок. Вот почему они готовы потратить 20 миллиардов долларов на приобретение такой компании».
Однако Ван выразил уверенность в долговечности архитектурных преимуществ Cerebras. Как Nvidia, так и Cerebras обновляют свое оборудование примерно ежегодно. «Мы обновляем наше аппаратное обеспечение по периодическому циклу. Скоро вы услышите новости об этом от нас», — сказал Ван, намекая на предстоящее объявление о новом оборудовании, но не раскрывая подробностей. Что касается программного обеспечения, Ван отметил историю компании по быстрой адаптации к быстро развивающейся экосистеме открытых моделей. «Мы начинали с Llama, поддерживали все модели Qwen, а когда разработчики сказали нам, что им нужен GLM, мы подключили GLM. И теперь они говорят нам, что Kimi лучшая – поэтому мы предоставляем им Kimi», — сказал он. «В то же время мы также поддерживали лучшие компании в запуске их закрытых моделей – OpenAI*, Cognition, Mistral».
Упоминание OpenAI* подчеркивает одно из самых необычных деловых отношений в ИИ-индустрии. OpenAI* и Cerebras заключили сделку в начале 2026 года, как сообщается, стоимостью более 20 миллиардов долларов США за вычислительные мощности и сопутствующие услуги. Ван подтвердил, что Cerebras обслуживает «внутренние модели кодирования OpenAI*, которые скоро появятся», но отказался раскрывать подробности, поскольку ни одна из сторон публично не детализировала технические условия.
План Cerebras: обслуживать самые умные ИИ-модели быстрее всех
Ван представил развертывание K2.6 как ступеньку, а не конечную цель. Cerebras начала предоставлять инференцию в конце 2024 года с относительно небольшими моделями и потратила более года на масштабирование от 70 миллиардов параметров до более чем триллиона. «Мы не могли запустить это в ноябре 2024 года», — сказал он. «Но сейчас мы достигли этого».
Следующая задача компании – перейти от обслуживания лучших открытых моделей до обслуживания лучших передовых моделей в целом, включая закрытые модели от таких компаний, как Anthropic и OpenAI*, которые находятся на вершине рейтингов интеллекта. «Это первая открытая передовая модель, для которой у нас теперь есть четкие доказательства», — заявил Ван. «Я думаю, в течение года вы увидите, как мы обслуживаем действительно передовые модели с той скоростью, которой мы славимся. И вы должны ожидать этого от нас».
На вопрос о том, будет ли текущее развертывание превзойдено темпами аппаратного улучшения у Nvidia и других, Ван остался невозмутим. «У Nvidia очень четкий план развития. Они публикуют его каждый год на GTC. Они примерно придерживаются годичного продуктового цикла, и мы тоже. Скоро вы услышите новости об этом от нас», — сказал он, намекая на новое оборудование, но не предлагая деталей.
Он также затронул вопрос о привязке к поставщику – обеспокоенность, которую поднял бы любой технический директор, оценивающий единственного поставщика инференции. «Эти предприятия редко полностью привязываются к одному поставщику», — отметил Ван. «У них есть стратегии для обеспечения того, чтобы часть трафика могла идти к нам, часть трафика – к кому-то другому, и существует балансировка нагрузки между ними. Это не новая проблема. Это обычный способ управления облачными ресурсами».
В конечном итоге, предложение Cerebras – это нечто большее, чем просто скорости и объемы. Ван видит, как индустрия ИИ сходится к миру, где автономные агенты, а не разработчики-люди, являются основными потребителями вычислительной мощности инференции, и где скорость этих агентов определяет конкурентные результаты для компаний, которые их используют. «Мировая экономика фактически перестраивается на агентах», — заявил Ван. «Скорость будет определять, кто победит, а кто проиграет».
Смотрите также:
Mercedes-AMG представляет электрический спорткар с динамикой болида http://stroybud.com/mercedes-amg-predstavlyaet-elektricheskiy-sportkar-s-dinamikoy-bolida/.
Интересности на тему: OpenClaw: как искусственный интеллект упрощает управление роботами
Классные советы в статье "Volvo EX60: шведский бренд перезапускает стратегию электромобилей после череды трудностей" здесь.
Это смелое заявление от компании, которая до прошлой недели никогда не торговалась на публичной бирже. Но для Cerebras логика проста: если будущее корпоративного программного обеспечения строится ИИ-агентами, которые думают со скоростью своего аппаратного обеспечения, то компания, предоставляющая самое быстрое аппаратное обеспечение, обеспечивает самое быстрое мышление. И на рынке, где предприятия тратят миллиарды, чтобы сократить время ответа своего ИИ на секунды, компания, способная обслуживать триллионно-параметрическую модель за время, пока заваривается чашка кофе, возможно, имеет самое убедительное предложение в Кремниевой долине.
* — деятельность компании запрещена на территории РФ


