NeoMME: an efficient Multimodal-native and Multilingual Encoder
Artikelbild eller återanvändbart omslag för Hugging Face
Hugging Face presenterar NeoMME, en ny AI-modell som är byggd för att förstå både text och bilder tillsammans.
Till skillnad från många andra modeller använder NeoMME inte separata komponenter för vision och språk, utan behandlar allt i en enda transformer. Modellen finns i två storlekar (260 miljoner och 800 miljoner parametrar) och är särskilt bra på att söka i dokument genom att analysera sidbilder istället för utvinnad text. Den kan processa omkring 51 sidor per sekund och använder mindre lagringsutrymme än tidigare modeller — 255 gånger mindre per sida enligt testningarna.
Unlike many generative visual language models, NeoMME does not use a separate pretrained vision tower or a causal language model.
Sammanfattningen har tagits fram med AI av Vibekollen utifrån källans publicering. Innehållet tillhör Hugging Face.
Mer att läsa
The Agent Said It Was Done. The Database Disagreed.
Hugging Face 4 okt.
Server-Side Code Execution Tools for AI Agents, Compared
OpenRouter för 10 tim sedan
v0.40.0
Ollama för 10 tim sedan
Google froze its open source bug bounty program due to a ‘significant rise’ in AI submissions
TechCrunch AI för 14 tim sedan