CPU-модель Daedalus-150M обходит GPT-2 при меньших данных
Гибрид из 6 блоков attention и 12 свёрточных обучен на 59.9B токенов и набрал 47.31 против порога 42.20. Он быстрее в 1.76 раза на контексте 2048 токенов и обходит MobileLLM-125M, хотя та видела триллион токенов.