Loophole: Adversarial Agents To Stress Test Your Morality — Brendan Rappazzo, Morgan Stanley
Loophole är ett AI-projekt av Brendan Rappazzo som testar om skrivna regler faktiskt motsvarar vad man moralpolitiskt menar.
Du beskriver dina värderingar på naturligt språk, en AI gör dem till formella regler, och sedan två motsatta agenter jagar efter luckor: en söker efter saker som är ommorala men lagliga, den andra efter saker som är moraliska men olagliga. En domare-agent bedömer om det bara är svårt formulerat eller ett genuint motsägelsefel i dina värderingar. Projektet utforskar flera vägar framåt, bland annat moraliska instruktioner för chatbotar, kontraktsanalys och en simulator som omskriver lagförslag tills de skulle passera den amerikanska senaten.
Sammanfattningen har tagits fram med AI av Vibekollen utifrån källans publicering. Innehållet tillhör AI Engineer.
Mer att läsa
Building advertising for the way people use AI
OpenAI för 2 tim sedan
Server-Side Code Execution Tools for AI Agents, Compared
OpenRouter för 12 tim sedan
v0.40.0
Ollama för 12 tim sedan
Google froze its open source bug bounty program due to a ‘significant rise’ in AI submissions
TechCrunch AI för 16 tim sedan