Large clusters for small models — Daniel Svonava, Superlinked
Daniel Svonava från Superlinked visar hur man kan köra många små AI-modeller effektivt på vanlig hårdvara istället för dyra molntjänster.
En enda GPU från några år sedan kan köra en liten modell snabbt, och för speciella uppgifter — som att läsa vietnamesiska kvitton eller granska kontrakt — fungerar dessa små modeller lika bra som större. Problemet är att servera många modeller samtidigt: befintliga verktyg är ooptimerade och routningsystem som är byggda för en stor modell blir långsamma när de får många små förfrågningar. Superlinked löser det med ett system där en gateway skickar förfrågningar till en gemensam kö, och arbetare hämtar och processar dem själva — det dubblerade genomströmningen. Ett rustverktyg hanterar olika modellvarianter, och systemet justerar modeller automatiskt; ett exempel kostade 80 cent och förbättrade tyska juridiska texter med 18 procent.
Sammanfattningen har tagits fram med AI av Vibekollen utifrån källans publicering. Innehållet tillhör AI Engineer.
Mer att läsa
Building advertising for the way people use AI
OpenAI för 3 tim sedan
Server-Side Code Execution Tools for AI Agents, Compared
OpenRouter för 13 tim sedan
v0.40.0
Ollama för 13 tim sedan
Google froze its open source bug bounty program due to a ‘significant rise’ in AI submissions
TechCrunch AI för 16 tim sedan