В свят, където големите езикови модели се надпреварват с все повече параметри и огромни бюджети, проект от Африка показва, че оптимизацията може да бъде по-важна от мащаба. Компанията Vambo AI представи езиковия модел Morena, който с едва 1,5 милиарда параметъра превъзхожда значително по-големи модели на Google, Meta и Alibaba при работа с африкански езици.
Моделът Morena поддържа 12 местни африкански езика, както и английски и френски, като освен това може да генерира програмен код. При ключов тест за ефективност той постига резултат от 1,408 bpb (битове на байт), което е най-добрият резултат сред 26 тествани модела. Най-близкият конкурент достига 1,423 bpb, въпреки че е около пет пъти по-голям.
Една от основните причини за добрите резултати е, че Vambo AI не е използвала стандартен голям модел, който просто да дообучи. Вместо това, компанията е оптимизирала предварително токенизатора, набора от обучаващи данни и избора на езици. Това води до значително по-ефективна обработка на африкански текст.
При едни и същи фрагменти Morena използва 1,39 пъти по-малко токени от Google Gemma 3 и 1,53 пъти по-малко от Llama 3.2. По-малкият брой токени означава по-малко изчисления, по-ниска цена и потенциално по-бърза работа. Тези предимства са особено важни в региони, където достъпът до мощна облачна инфраструктура не винаги е лесен. За сравнение, Gemma с 12 милиарда параметъра използва приблизително 11 пъти повече изчислителни ресурси от Morena.
Версията Morena Instruct, оптимизирана за диалог, постига 1,441 bpb и превъзхожда специализирания модел Lugha-Llama-8B при пет общи езика, въпреки че използва едва около 20% от неговия брой параметри. При превод от английски към пет африкански езика Morena достига 45,8 точки по chrF++, което е близо до резултатите на специализираните системи за машинен превод, докато сравними по размер модели обикновено постигат между 9 и 14 точки.
Проектът е забележителен и с относително малкия си бюджет за стандартите на съвременния генеративен AI. Разходите за изчислителни ресурси за обучението, което е изисквало над 22 000 часа работа на Nvidia A100 ускорители, са около 40 000 долара. Освен основния модел, Vambo AI предлага и версии с 500 милиона и 200 милиона параметъра, като дори 500-милионният модел е успял да изпревари всички тествани конкурентни модели при 11 от 12 езика. Най-малкият вариант е предназначен за задачи като разпознаване на реч и може да работи директно на централен процесор.
По информация на Kaldata.



