Stop Chunking Like It's 2022 — Yuval Belfer, AI21 Labs
Yuval Belfer från AI21 Labs visar att det inte finns en universell rätt storlek för hur man delar upp text när man indexerar data för AI-sökning.
Ett exempel: en fråga om Jerrys favoritkyrka i Seinfeld-avsnitt hittas bäst med små textbitar, medan en fråga om hans ärkefiende kräver större sammanhang. Hans lösning är att indexera samma data sex gånger med olika storlekar, söka i alla samtidigt, och sedan rangordna de träffade dokumenten tillsammans istället för att välja en fast storlek. Metoden kostar två till fem gånger mer minne men ger 20-40 procent bättre sökresultat.
Sammanfattningen har tagits fram med AI av Vibekollen utifrån källans publicering. Innehållet tillhör AI Engineer.
Mer att läsa
Building advertising for the way people use AI
OpenAI för 2 tim sedan
Server-Side Code Execution Tools for AI Agents, Compared
OpenRouter för 12 tim sedan
v0.40.0
Ollama för 12 tim sedan
Google froze its open source bug bounty program due to a ‘significant rise’ in AI submissions
TechCrunch AI för 16 tim sedan