LFM2.5-VL-3B for Better and Faster Vision Capabilities for the Edge
Artikelbild eller återanvändbart omslag för Hugging Face
Liquid AI presenterar LFM2.5-VL-3B, en vision-language-modell — en AI som kan både se bilder och förstå text.
Modellen är liten nog att köra direkt på din telefon eller dator och klarar fyra nya saker bra: förstår skärmar och gränssnitt, kan peka ut objekt när du beskriver dem, kan analysera flera bilder tillsammans, och kan anropa verktyg och funktioner. Modellen är tränad på 34 biljoner tokens med fyra gånger mer bilddata än tidigare versioner och stödjer många språk inklusive icke-latinska skriftsystem. I tester slår den andra modeller i sin storlek när det gäller verkliga bilduppgifter som att läsa dokument, skärmar och grafer.
LFM2.5-VL-3B extends the vision-language capabilities of our previous releases with four major improvements: Screen/UI understanding: Strong understanding of digital screens across different devices. Grounding: Improved grounding and object detection with natural language queries. Multi-image input: Improved reasoning
Sammanfattningen har tagits fram med AI av Vibekollen utifrån källans publicering. Innehållet tillhör Hugging Face.