BloggOpenAI
Introducing Intelligence Age
Introducing Intelligence Age, a new OpenAI blog exploring how transformative AI could reshape power, governance, the economy, and individual freedom.
20 aug. openai.com
Vibekollen Nytt
Hämtar senaste nytt…
Vibekollen Nytt
Modeller, verktyg och händelser som formar AI-världen. Hitta nyheter, video och poddar – och följ vad som händer på Vibekollen.
Alla nyheter i tidsordning. Använd filtren för att hitta ditt ämne, din podd eller ditt verktyg.
BloggOpenAI
Introducing Intelligence Age, a new OpenAI blog exploring how transformative AI could reshape power, governance, the economy, and individual freedom.
20 aug. openai.com
BloggOpenAI
Introducing AI Futures, a new OpenAI blog exploring how transformative AI could reshape power, governance, the economy, and individual freedom.
20 aug. openai.com
VideoAI Engineer
Safia Abdalla från Warp presenterar hur de byggt en molnbaserad agent-plattform som hjälper utvecklare utan att överbelasta dem. Istället för att låta agenter agera fritt sätter de dem in i arbetets naturliga flöde — agenter trierar issues, granskar pull requests och godkänner dem innan människor behöver se dem. Plattformen stödjer olika utvecklarverktyg, låter agenter samarbeta med underagenter, och kan användas av vem som helst via ett API — till exempel användes det för att bygga Slack-verktyg för triering. Abdalla betonar att en bra agent-plattform ska absorbera komplexitet innan den når användaren, och jämför det med en potterverkstad snarare än en fabrik.
20 aug. youtube.com
VideoAI Engineer
Patrick Debois jämför dagens utmaningar med AI-agenter med motståndet mot continuous delivery 2009 — tekniken fungerar, men organisationen är inte redo. Hans poäng är att det som blir skillnaden är inte själva agenten eller promperna, utan hur teamet, plattformen och arbetssätten förändras omkring den. Istället för att fixa agentens kod bör man förbättra systemet som helhet. Det handlar om att minska antal gånger en människa måste röra vid en uppgift, och om att göra förbättringar som drar nytta för hela teamet, inte bara en person.
20 aug. youtube.com
VideoAI Engineer
Sachin Malhotra från Anthropic berättar om en agent som råkade ta bort 200 arbetsjobb på 90 sekunder — en påminnelse om risken med att ge AI-agenter för mycket makt. Problemet var inte att agenten var elak, utan att den fick obegränsad tillåtelse. Istället för att bara begränsa vad en agent får göra (token-baserad kontroll) föreslår Malhotra ett "budget"-system med fyra dimensioner: hur mycket, hur snabbt, vad som kan återställas, och vem som övervakar. Det handlar om att ge agenter operationer som misslyckas tydligt (som att ångra något) medan människor behåller kontrollen över saker som misslyckas i tysthet, plus hastighetsrestriktioner och övervakningsmeknanismer.
20 aug. youtube.com
BloggOpenAI
Stampli är ett företag som hade bråttom att lansera en produkt men hade begränsade resurser tillgängliga. De använde OpenAIs verktyg Codex och ChatGPT Work för att snabba upp utvecklingen kraftigt — de packade in veckor av arbete på bara några dagar för att hinna med deadlinen.
20 aug. openai.com
VideoAI Engineer
Teams built orchestration graphs because the models of 2024 could not be trusted to orchestrate, and then the models learned to orchestrate and the graphs became the thing holding them back. Ameya Bhatawdekar traces that loop across five generations of architecture, each one forced by a step change in model capability, and argues that evals have to move with it. A single prompt needed only answer quality. A retrieval chain added a parser that grabs the wrong field and a retriever that returns the wrong context. Graphs added branch logic, contracts between nodes, and classifier nodes that misfire quietly, which is a great deal of new surface to check. What changed most recently is not another layer but the unit of measurement. Once a loop is reliable enough to run free, the same input produces visibly different trajectories on every run, so a single eval result stops meaning very much. He separates the two questions it hides. Pass at k asks whether the system succeeds at least once across k attempts, which measures capability. The stricter variant asks how many of those k attempts succeed, which measures reliability.
20 aug. youtube.com
VideoAI Engineer
Kieran Klaassen har byggt en fullständig e-postklient helt ensam med hjälp av AI, utan att själv skriva eller läsa större delen av koden. Han beskriver en arbetsgång där han upptäckte att flaskhalsen inte längre var kodkvaliteten utan istället hans egen tid — han blev begränsad av upprepningar och beslut som bara han kunde ta. För att lösa det byggde han ett minnessystem som lagrar lösningar från tidigare problem, så nästa gång en liknande utmaning dyker upp behöver AI-verktyget inte börja från noll. Hans huvudinsikt är att han lägger ungefär hälften av tiden på att bygga en funktion och hälften på att lära systemet vad det gjorde fel, vilket på sikt blir billigare i termer av AI-användarkvoter — och viktigare: nästa funktion blir lättare att bygga.
20 aug. youtube.com
BloggOpenAI
OpenAI bekräftar att de erbjuder noll datalagringar för vissa API-kunder — vilket betyder att data från dina API-anrop inte sparas eller används för att träna OpenAI:s modeller. De presenterar också en ny funktion kallad Private Safety Processing som granskar om innehålet följer reglerna utan att spara uppgifterna.
19 aug. openai.com
BloggOpenAI
OpenAI bekräftar att de erbjuder noll datalagrering för API-kunder som använder deras mest avancerade modeller — det betyder att OpenAI inte sparar eller använder din data för att träna sina system. Företaget presenterar också en ny funktion kallad Private Safety Processing som låter företag kontrollera hur AI-säkerhetskontroller fungerar utan att OpenAI får tillgång till känslig data.
19 aug. openai.com
VideoAI Engineer
Christopher Lovejoy och Saul Howard visar varför många AI-agenter misslyckas i företag trots att prototyperna fungerar bra. Problemet är att compliance-krav som revisionshistorik ofta klistras på efteråt istället för att byggas in från början. De föreslår en arkitektur som utgår från begränsningar: en omutable händelselog som registrerar varje åtgärd agenten tar, patientdata lagrat separat från loggen så agenter kan debuggas utan att se känslig information, och att behandla både människor och AI-modeller som samma typ av agent. Detta gör att granskning, säkerhet och eskalering blir naturliga delar av systemet istället för tillägg.
19 aug. youtube.com
VideoAI Engineer
Anterior arbetar med medicinsk data som ofta kommer som faxade dokument på över 300 sidor med handskrifter och tabeller — men de får inte spara denna data på grund av juridiska krav. Istället för att försöka träna AI på data de inte får behålla, kör de processen baklänges: de börjar med rätt svar (diagnosen eller besluten), arbetar bakåt genom resonemanget, och genererar sedan de patientjournaler som skulle ha lett dit. Eftersom de modellerar medicinska riktlinjer som beslutsträd har det genererade materialet större variation och är mer realistiskt än om en AI-modell bara försökte hitta på data själv. Resultatet är att ungefär 90 procent av deras träningsdata nu är syntetisk, och läkare kan bara skilja syntetisk från verklig data ungefär 60 procent av tiden.
19 aug. youtube.com
VideoAI Engineer
Dan Feng från Maven Clinic, en hälsovårdsapp, beskriver hur AI förändrar hur företag planerar och bygger produkter. Eftersom det nu tar minuter att bygga något istället för veckor, har kostnaderna skiftat — det dyra är nu att diskutera vad man ska bygga, inte att bygga det. Maven Clinic planerar bara två till fyra veckor framåt i detalj, medan långsiktiga planer bara fungerar som riktning. Kodgranskningar blev också ett problem när ingenjörer skrev tio gånger mer kod än tidigare, så Maven låter ingenjörer själva bedöma vilka ändringar som behöver granskas av två personer. För kritiska funktioner som att räkna ut ersättningar använder de flera AI-modeller som måste komma överens innan något går igenom.
19 aug. youtube.com
VideoAI Engineer
Ayush Bhardwaj arbetar med AI-verktyg i två mycket olika branscher — finansiell handel och läkemedelsutveckling — och upptäckte att problemen är nästan identiska. Det stora problemet är att kunna bedöma om det AI-systemet bygger faktiskt är bra: en erfaren kodare ser på en minut om genererad kod är svag, men ingen på hans team kunde döma kvaliteten på en handelsstrategi eller ett läkemedelskandidatförslag. Han försökte först lösa det genom att träna en modell att bedöma resultaten, men det fungerade inte eftersom viktig data hålls hemlig (tradingfonder vill inte avslöja vinnande strategier, och cirka 30 procent av läkemedelsföretagen publicerar aldrig sina försökresultat). Lösningen blev att anställa en senior expert från respektive område som kan bedöma resultaten, välja bästa datakällor och förfina hur man ber AI-systemet om hjälp. Expertisen och datan är det enda som skapar ett verkligt konkurrensförsprång — själva AI-modellen och infrastrukturen är i princip utbytbar.
19 aug. youtube.com
VideoAI Engineer
Vasant Kearney från Onlay menar att när AI-agenter hanterar sjukvårdsersättningar bör de använda X12 — standarden för försäkringskommunikation — som ett ramverk snarare än bara ett filformat. Problemet är att en försäkringsgivares telefonsystem, webbportal och X12-data ofta är byggda av olika team och kan motsäga varandra eller bli felaktiga tillsammans. Genom att använda X12 som ett strukturerande ramverk kan AI-agenter normalisera alla möjligheter — ett telefonsamtal, en portalinteraktion, en försäkringskontroll — till samma underliggande transaktion. Han betonar två praktiska krav: minnet måste lagras i en databas för logisk separation, och en "bättre" AI-modell kan inte bara bytas in, eftersom bättre på ett test inte betyder bättre inom ett system byggt runt en annan modell.
19 aug. youtube.com