Routing LLM Inference in Production: From Engine Signals to Policy — Qianru Lao & Lu Zhang, OpenAI
OpenAI har utvecklat ett nytt routingssystem för sin AI-inferens i produktion.
Tidigare använde de en återkopplingsloop där motorer rapporterade prestanda-signaler som en styrenhet omvandlade till vikter, men detta skapade svårförklarat beteende och oscillation som skadade cacheminnet. Det nya systemet använder en kontrollplan med global överblick över alla kluster och en dataplan i varje kluster som väljer vilken motor som ska serva varje förfrågan baserat på cachade vikter. En optimizer minimerar slutlig latens under begränsningen att alla förfrågningar ruttas och ingen motor överbelastas, med exempel på hur geografisk närhet inte alltid är optimal — långsamt svar från närmaste motor kan slå långt borta motorer.
Sammanfattningen har tagits fram med AI av Vibekollen utifrån källans publicering. Innehållet tillhör AI Engineer.
Mer att läsa
Building advertising for the way people use AI
OpenAI för 1 tim sedan
Server-Side Code Execution Tools for AI Agents, Compared
OpenRouter för 11 tim sedan
v0.40.0
Ollama för 11 tim sedan
Google froze its open source bug bounty program due to a ‘significant rise’ in AI submissions
TechCrunch AI för 15 tim sedan