Hoppa till innehåll
VibekollenBETAVibekollen
VideoAI Engineer

Routing LLM Inference in Production: From Engine Signals to Policy — Qianru Lao & Lu Zhang, OpenAI

OpenAI har utvecklat ett nytt routingssystem för sin AI-inferens i produktion.

Tidigare använde de en återkopplingsloop där motorer rapporterade prestanda-signaler som en styrenhet omvandlade till vikter, men detta skapade svårförklarat beteende och oscillation som skadade cacheminnet. Det nya systemet använder en kontrollplan med global överblick över alla kluster och en dataplan i varje kluster som väljer vilken motor som ska serva varje förfrågan baserat på cachade vikter. En optimizer minimerar slutlig latens under begränsningen att alla förfrågningar ruttas och ingen motor överbelastas, med exempel på hur geografisk närhet inte alltid är optimal — långsamt svar från närmaste motor kan slå långt borta motorer.

Öppna på YouTube →

Sammanfattningen har tagits fram med AI av Vibekollen utifrån källans publicering. Innehållet tillhör AI Engineer.

Mer att läsa