Hoppa till innehåll
VibekollenBETAVibekollen
BloggHugging Face

Safety for Whom? Refusing the Right Subset of a Topic, Not the Whole Topic

Bild från huggingface.co

Hugging Face presenterar en ny forskning om hur AI-modeller ska vägra att svara på vissa frågor utan att bli för strikta.

Problemet är att dagens säkerhetssystem ofta arbetar på tema-nivå — om en modell vägrar att diskutera politik, vägrar den allt om politik. I verkligheten behöver många tillämpningar (en civics-tutor kontra en allmän assistent) olika regler inom samma tema. Forskarna definierar problemet som att identifiera exakt vilka delfrågor inom ett tema som ska vägras, och tränar modeller med parvis motsatta prompter — en som ska vägras, en som ska besvaras. De visar att standard-metoder tappar svåra exempel under träningen, producerar falskt vägring på harmlösa frågor, och att man måste mäta båda sidorna av gränsen för att undvika att bli alltför restriktiv.

The question is not whether an entire topic should be refused, but which subset of that topic is incompatible with a given deployment policy, and how to train and measure a model against that boundary.
Ordagrant ur artikeln hos Hugging Face
Läs hela hos Hugging Face →

Sammanfattningen är skriven av Vibekollen utifrån källans egen publicering. Innehållet tillhör Hugging Face.

Mer att läsa