Додека се мисли дека Кина бара начини да ги заобиколи американските ограничувања за компјутерски ресурси, кинеската компанија Moonshot AI го претстави досега најголемиот модел со отворени тежини. Со 2,8 билиони параметри моделот Kimi K3 го надмина и Claude Fable 5 во бенчмаркот Frontend Code Arena.
Moonshot AI од Пекинг го пушти во оптек Kimi K3 моделот со 2,8 билиони (2,8*10^12) параметри. Во својот технички блог компанијата го опишува како прв во светот систем од класата 3T со отворени тежини и досега најголем модел со отворени тежини.
Moonshot наведува дека K3 сè уште заостанува зад Claude Fable 5 на Anthropic и GPT 5.6 Sol на OpenAI во однос на севкупните перформанси, но и дека при изведениот сет на евалуации моделот ги надминал во тестовите за програмирање и во агентски способности сите други модели, тука вклучувајќи ги Claude Opus 4.8 и GPT 5.5.
Моделот има контекстен прозорец од 1 милион токени, поддршка за визуелни податоци од самиот почеток и активира само 16 од вкупно 896 експерти за секој токен, односно приближно 1,8% од целиот систем. Целосните тежини на моделот се очекува да бидат објавени дополнително.
Arena го рангираше K3 на прво место во својата евалуација за Frontend Code, со 1.679 поени, пред Fable 5, врз основа на слепо тестирање од страна на програмери.
Цената за користење преку API изнесува 0,30 долари за милион влезни токени при погодок во кешот, 3 долари за милион токени при промашување на кешот и 15 долари за милион излезни токени. Kimi K2 беше лансиран пред една година со цена од 0,60 долари за милион влезни токени, што значи дека некешираните влезни токени кај K3 чинат петпати повеќе.
Moonshot тврди дека постигнал приближно 2,5 пати подобра ефикасност при скалирањето во споредба со Kimi K2, што се припишува на две архитектонски промени – Kimi Delta Attention, хибридна шема на линеарно внимание, и Attention Residuals, којашто го менуваат начинот на кој информациите се пренесуваат меѓу слоевите.
Обуката свесна за квантизацијата започнува уште во фазата на надгледувано дообучување (supervised fine-tuning), со користење на MXFP4 тежини и MXFP8 активации, комбинација за која Moonshot вели дека е избрана поради широката компатибилност со различен хардвер.
Според Том'с Хардвер, аналитичарите на Bank of America, предводени од Алекс Лиу, во белешка цитирана од CNBC наведоа дека K3 покажува оти големото претходно обучување, во комбинација со архитектонски подобрувања, сè уште може да донесе значителни скокови во перформансите кај водечките кинески модели, и покрај ограничувањата во поглед на компјутерските ресурси.

Бенчмаркот за оптимизација на кернелот на Moonshot бил извршен на Nvidia H200, како и на она што блогот го идентификува само како „GPGPU од алтернативен производител“, без компанијата да го наведе неговото име.
MiniTriton, компајлер сличен на Triton што K3 го има изградено од нула, е прикажан во споредба со Triton на Nvidia L20 — поедноставена графичка картичка базирана на архитектурата Ada, која се продава во Кина во согласност со американските извозни правила.
Moonshot препорачува K3 да се користи на суперјазли со 64 или повеќе акцелератори, при што сообраќајот меѓу експертите да остане во рамките на еден домен со висок пропусен опсег. Во блогот не се наведува каде се наоѓа хардверот H200. Американскиот конгрес во јануари годинава усвои закон со кој се настојува да се затвори дупката во правилата за изнајмување облачни ресурси во странство, инфраструктура која им овозможуваше на кинеските компании далечински пристап до ограничени акцелератори.

Во една студија на случај, K3 поминал една автономна сесија од 48 часа во дизајнирање симулиран чип за инференција за нано-модел изграден врз сопствената архитектура, користејќи алатки за електронска автоматизација на дизајнот (EDA) со отворен код и библиотеката Nangate 45nm.
Дизајнот успешно ги исполнил временските барања на 100 MHz во површина од 4 квадратни милиметри, содржел 1,46 милиони стандардни логички ќелии и INT4 MAC низа, и постигнал повеќе од 8.700 токени во секунда при симулирано декодирање.