LFM2.5-VL-3B for Better and Faster Vision Capabilities for the Edge
Bild från huggingface.co
Liquid AI presenterar LFM2.5-VL-3B, en vision-language-modell — en AI som kan både se bilder och förstå text.
Modellen är liten nog att köra direkt på din telefon eller dator och klarar fyra nya saker bra: förstår skärmar och gränssnitt, kan peka ut objekt när du beskriver dem, kan analysera flera bilder tillsammans, och kan anropa verktyg och funktioner. Modellen är tränad på 34 biljoner tokens med fyra gånger mer bilddata än tidigare versioner och stödjer många språk inklusive icke-latinska skriftsystem. I tester slår den andra modeller i sin storlek när det gäller verkliga bilduppgifter som att läsa dokument, skärmar och grafer.
LFM2.5-VL-3B extends the vision-language capabilities of our previous releases with four major improvements: Screen/UI understanding: Strong understanding of digital screens across different devices. Grounding: Improved grounding and object detection with natural language queries. Multi-image input: Improved reasoning
Sammanfattningen är skriven av Vibekollen utifrån källans egen publicering. Innehållet tillhör Hugging Face.
Mer från Hugging Face
IBM releases SOTA Granite Time Series PatchTST-FM-r2 model with commercial-friendly license
Hugging Face för 6 tim sedan
Safety for Whom? Refusing the Right Subset of a Topic, Not the Whole Topic
Hugging Face 8 sep.
The exact tools used to port a massive codebase in days #programming #typescript #dev
AI Engineer för 2 tim sedan
v2.1.267
Claude Code för 2 tim sedan