VideoAI Engineer
Routing LLM Inference in Production: From Engine Signals to Policy — Qianru Lao & Lu Zhang, OpenAI
OpenAI har utvecklat ett nytt routingssystem för sin AI-inferens i produktion. Tidigare använde de en återkopplingsloop där motorer rapporterade prestanda-signaler som en styrenhet omvandlade till vikter, men detta skapade svårförklarat beteende och oscillation som skadade cacheminnet. Det nya systemet använder en kontrollplan med global överblick över alla kluster och en dataplan i varje kluster som väljer vilken motor som ska serva varje förfrågan baserat på cachade vikter. En optimizer minimerar slutlig latens under begränsningen att alla förfrågningar ruttas och ingen motor överbelastas, med exempel på hur geografisk närhet inte alltid är optimal — långsamt svar från närmaste motor kan slå långt borta motorer.
19 sep. youtube.com