BloggHugging Face
NeoMME: an efficient Multimodal-native and Multilingual Encoder
Hugging Face presenterar NeoMME, en ny AI-modell som är byggd för att förstå både text och bilder tillsammans. Till skillnad från många andra modeller använder NeoMME inte separata komponenter för vision och språk, utan behandlar allt i en enda transformer. Modellen finns i två storlekar (260 miljoner och 800 miljoner parametrar) och är särskilt bra på att söka i dokument genom att analysera sidbilder istället för utvinnad text. Den kan processa omkring 51 sidor per sekund och använder mindre lagringsutrymme än tidigare modeller — 255 gånger mindre per sida enligt testningarna.
3 sep. huggingface.co