Up to 3.2x Faster Inference with LFM2.5-DSpark
Artikelbild eller återanvändbart omslag för Hugging Face
Liquid AI har lanserat DSpark-versioner av sina LFM2.5-språkmodeller som gör inferensen upp till 3,2 gånger snabbare på GPU och 2,87 gånger snabbare på enheter som MacBook Pro.
DSpark använder en mindre "draft"-modell (omkring 300 miljoner parametrar) som föreslog tokens som en större modell sedan verifierar — på så sätt delas kostnaderna för att läsa vikter från minne över flera tokens samtidigt. Tekniken reducerar latensen för funktionsanrop med 57 procent i genomsnitt för den minsta modellen. Modellerna finns redan integrerade med llama.cpp och SGLang, två populära ramverk för att köra språkmodeller.
Faster inference: up to 3.18 throughput improvement on a GPU and up to 2.87x on-device.
Sammanfattningen har tagits fram med AI av Vibekollen utifrån källans publicering. Innehållet tillhör Hugging Face.
Mer att läsa
The Agent Said It Was Done. The Database Disagreed.
Hugging Face 4 okt.
Server-Side Code Execution Tools for AI Agents, Compared
OpenRouter för 10 tim sedan
v0.40.0
Ollama för 11 tim sedan
Google froze its open source bug bounty program due to a ‘significant rise’ in AI submissions
TechCrunch AI för 14 tim sedan