Hoppa till innehåll
VibekollenBETAVibekollen
BloggHugging Face

NeoMME: an efficient Multimodal-native and Multilingual Encoder

Bild från huggingface.co

Hugging Face presenterar NeoMME, en ny AI-modell som är byggd för att förstå både text och bilder tillsammans.

Till skillnad från många andra modeller använder NeoMME inte separata komponenter för vision och språk, utan behandlar allt i en enda transformer. Modellen finns i två storlekar (260 miljoner och 800 miljoner parametrar) och är särskilt bra på att söka i dokument genom att analysera sidbilder istället för utvinnad text. Den kan processa omkring 51 sidor per sekund och använder mindre lagringsutrymme än tidigare modeller — 255 gånger mindre per sida enligt testningarna.

Unlike many generative visual language models, NeoMME does not use a separate pretrained vision tower or a causal language model.
Ordagrant ur artikeln hos Hugging Face
Läs hela hos Hugging Face →

Sammanfattningen är skriven av Vibekollen utifrån källans egen publicering. Innehållet tillhör Hugging Face.

Mer från Hugging Face