NeoMME: an efficient Multimodal-native and Multilingual Encoder
Bild från huggingface.co
Hugging Face presenterar NeoMME, en ny AI-modell som är byggd för att förstå både text och bilder tillsammans.
Till skillnad från många andra modeller använder NeoMME inte separata komponenter för vision och språk, utan behandlar allt i en enda transformer. Modellen finns i två storlekar (260 miljoner och 800 miljoner parametrar) och är särskilt bra på att söka i dokument genom att analysera sidbilder istället för utvinnad text. Den kan processa omkring 51 sidor per sekund och använder mindre lagringsutrymme än tidigare modeller — 255 gånger mindre per sida enligt testningarna.
Unlike many generative visual language models, NeoMME does not use a separate pretrained vision tower or a causal language model.
Sammanfattningen är skriven av Vibekollen utifrån källans egen publicering. Innehållet tillhör Hugging Face.
Mer från Hugging Face
IBM releases SOTA Granite Time Series PatchTST-FM-r2 model with commercial-friendly license
Hugging Face för 5 tim sedan
Safety for Whom? Refusing the Right Subset of a Topic, Not the Whole Topic
Hugging Face 8 sep.
The exact tools used to port a massive codebase in days #programming #typescript #dev
AI Engineer för 45 min sedan
v2.1.267
Claude Code för 55 min sedan