BloggHugging Face
Up to 3.2x Faster Inference with LFM2.5-DSpark
Liquid AI har lanserat DSpark-versioner av sina LFM2.5-språkmodeller som gör inferensen upp till 3,2 gånger snabbare på GPU och 2,87 gånger snabbare på enheter som MacBook Pro. DSpark använder en mindre "draft"-modell (omkring 300 miljoner parametrar) som föreslog tokens som en större modell sedan verifierar — på så sätt delas kostnaderna för att läsa vikter från minne över flera tokens samtidigt. Tekniken reducerar latensen för funktionsanrop med 57 procent i genomsnitt för den minsta modellen. Modellerna finns redan integrerade med llama.cpp och SGLang, två populära ramverk för att köra språkmodeller.
20 aug. huggingface.co