Safety for Whom? Refusing the Right Subset of a Topic, Not the Whole Topic
Artikelbild eller återanvändbart omslag för Hugging Face
Hugging Face presenterar en ny forskning om hur AI-modeller ska vägra att svara på vissa frågor utan att bli för strikta.
Problemet är att dagens säkerhetssystem ofta arbetar på tema-nivå — om en modell vägrar att diskutera politik, vägrar den allt om politik. I verkligheten behöver många tillämpningar (en civics-tutor kontra en allmän assistent) olika regler inom samma tema. Forskarna definierar problemet som att identifiera exakt vilka delfrågor inom ett tema som ska vägras, och tränar modeller med parvis motsatta prompter — en som ska vägras, en som ska besvaras. De visar att standard-metoder tappar svåra exempel under träningen, producerar falskt vägring på harmlösa frågor, och att man måste mäta båda sidorna av gränsen för att undvika att bli alltför restriktiv.
The question is not whether an entire topic should be refused, but which subset of that topic is incompatible with a given deployment policy, and how to train and measure a model against that boundary.
Sammanfattningen har tagits fram med AI av Vibekollen utifrån källans publicering. Innehållet tillhör Hugging Face.
Mer att läsa
The Agent Said It Was Done. The Database Disagreed.
Hugging Face 4 okt.
Server-Side Code Execution Tools for AI Agents, Compared
OpenRouter för 10 tim sedan
v0.40.0
Ollama för 11 tim sedan
Google froze its open source bug bounty program due to a ‘significant rise’ in AI submissions
TechCrunch AI för 14 tim sedan