KV Cache-Aware Routing and P/D Disaggregation on Kubernetes — Yuchen Fama & Ashish Kamra, Red Hat
Red Hat-ingenjörerna Yuchen Fama och Ashish Kamra presenterar två sätt att göra AI-modeller snabbare när man kör dem på servrar.
Det första är smart routing — när en användare ställer följdfrågor återanvänds tidigare beräkningar på samma server, vilket gör svaret 3 gånger snabbare. Det andra är att dela upp arbetet mellan två typer av servrar: en som förbereder texten och en som genererar ord. I ett praktiskt test föll väntetiden mellan ord från 900 millisekunder till 100 millisekunder. Men disaggregation fungerar bara bra vid medelhög belastning och kräver särskild nätverkshårdvara — annars är det bättre att hålla allt på en server.
Sammanfattningen är skriven av Vibekollen utifrån källans egen publicering. Innehållet tillhör AI Engineer.
Mer från AI Engineer
The exact tools used to port a massive codebase in days #programming #typescript #dev
AI Engineer för 3 tim sedan
The Universal Remote Control for AI — Alex Hancock, Block
AI Engineer för 7 tim sedan
MCP Apps: Give the Model Data, Give the User a UI — Dustin Mihalik, Indeed
AI Engineer för 7 tim sedan
Your agents lack context: Here's how to fix "You're absolutely right!" — Brandon Waselnuk, Unblocked
AI Engineer för 8 tim sedan