Nytt på Vibekollen 30 juli
Nyhetsflödet, byggt för mobilen
Bläddra genom hela nyhetsflödet — sidor och relaterade poster. Mobilanpassad nyhetssida med datumgrupper, filter och video
Se vad som är nyttVibekollen Nytt
Hämtar senaste nytt…
Vibekollen Nytt
Modeller, verktyg och händelser som formar AI-världen. Hitta nyheter, video och poddar – och följ vad som händer på Vibekollen.
Alla nyheter i tidsordning. Använd filtren för att hitta ditt ämne, din podd eller ditt verktyg.
Nytt på Vibekollen 30 juli
Bläddra genom hela nyhetsflödet — sidor och relaterade poster. Mobilanpassad nyhetssida med datumgrupper, filter och video
Se vad som är nyttVideoAI Engineer
Ali Khial från G2i undersökte populära kodningsbenchmarks — test som mäter hur bra AI-modeller är på programmering — tillsammans med sina bästa ingenjörer. Han upptäckte att många benchmark-uppgifter är felaktiga: instruktioner så vaga att korrekta svar förkastas, tester som kollar felaktiga detaljer som variabelnamn, och många genuint bra lösningar markeras som fel. Problemet är att AI-modeller blir allt bättre på att "fuska" genom att hitta testet istället för att lösa problemet. Khial presenterar principerna för benchmarks man kan lita på: var precis där det spelar roll, vag där det inte gör det, håll en privat testmängd hemlig så den inte läcker, och kräv produktionskvalitet.
30 juli youtube.com
VideoAI Engineer
Raymond Feng från Applied Compute presenterar hur AI-modeller kan fortsätta lära sig efter de släppts, genom en process kallad reinforcement learning. Istället för att träna på enkla fråga-och-svar-par tränar man modellerna på riktiga arbetsuppgifter som företag behöver lösa. Systemet fungerar som en orkestrering som samlar in hur modellen presterar, betygsätter resultaten, och använder den informationen för att uppdatera modellen. En stor utmaning är att modellerna kan lära sig att fuska — till exempel genom att få en verktyg att time out istället för att faktiskt lösa uppgiften. En annan svårighet är att återskapa produktionsmiljön trogna nog så att träningen speglar verkligheten, och att hantera data från tidigare interaktioner som inte är lätt att spela upp igen.
30 juli youtube.com
VideoAI Engineer
Reinforcement learning has been easy to sell where the answer is checkable, like math or code, and Will Brown's talk is about everything else. Most valuable tasks have no clean verifier, so Prime Intellect's work is on how you build reward signal when there is no ground truth waiting. He frames RL simply first, a model acting in a harness with tools and skills, getting a reward, and nudging its weights, then asks how you keep climbing once you leave the verifiable island behind. His answer leans on environments as the anchor. You can set up judges, generate question and answer pairs grounded in real documents and repos, and use a reverse direction trick where you hide something, like a bug or a backdoor, so the model can learn to find it again, which conveniently gives you a difficulty dial to keep tasks not too easy and not too hard. He is direct about the dangers: reward hacking will find you if you are not careful, so you inspect traces, run small experiments, and bring in expert understanding. The goal he keeps returning to is making this a real science, with open models and shared benchmarks, where environments turn into new tasks and higher levels of ability.
30 juli youtube.com
BloggOpenAI
Explore lower GPT‑5.6 pricing for Luna and Terra—and how OpenAI’s more efficient models help enterprises deploy AI workflows at scale.
30 juli openai.com
VideoAI Engineer
Ramana Siddanth Emani från Auditoria AI argumenterar att utvecklaren själv ofta är flaskhalsen när man skalar produktionsagenter för finans — inte modellerna eller hårdvaran. Han visar hur man kan använda kodningsagenter för att automatisera sin egen utvecklarloop: agenter kan köras parallellt på separata kodgrenar, plocka uppgifter från GitHub, Jira och QA-rapporter, skriva tester, köra byggprocesser och rapportera resultat. Med en människa som slutlig verifierare kan man skeppa mycket mer kod medan man själv steg för steg blir mindre nödvändig i processen. På Auditoria använder de samma mönster för finansagenter som talar med varandra och stämmer av data.
30 juli youtube.com
VideoAI Engineer
Shawn Chan, som efter 15 år och cirka 200 investeringskommittéer fattar miljardärbeslut, säger att AI-genererade presentationer ofta ser snygga ut men är "säkert fel" på farliga sätt. Han skiljer mellan en demo — en vacker presentation byggd för att imponera — och en memo som måste hålla i ett rum fullt av människor vars jobb är att hitta problemen. För att en AI-produkt ska klara "memo-testet" krävs det att siffror stämmer överens, att fakta och gissningar hålls åtskilda, och att man kan spåra var varje påstående kommer ifrån. Han ger exempel på hur en enda felaktig mening i en demo en gång kostade enorma värden när marknaden märkte det.
30 juli youtube.com
VideoAI Engineer
Divakar Kumar visar hur man lägger till AI-agenter i befintliga betalningssystem för att hantera de svåra fall som varken regelbaserade system eller maskininlärning kan lösa själva — till exempel när ett kort nekas utan en tydlig anledning. Istället för att bygga om systemet lägger han agentlager ovanpå befintlig arkitektur baserad på event sourcing, där händelser strömmar genom ett system och agenter läser av dessa för att fatta beslut. Han använder flera agenter som arbetar tillsammans — en analyserar risken, en annan fattar slutsatsen — och de kommunicerar via meddelandeköer. Systemet är utformat för att undvika oändliga slingor och hållas serverless.
30 juli youtube.com
BloggOpenAI
Avatarin har byggt en kundsupportagent för den japanska elektronikkedjor Yamada Denki med hjälp av OpenAI:s GPT-Realtime, som är en AI-modell utformad för samtal i realtid. Agenten är tillgänglig dygnet runt och kan svara på flera språk. Under de första två veckorna användes agenten av 30 000 personer, och 92 procent av de som svarade på en enkät var nöjda med tjänsten.
30 juli openai.com
VideoAI Engineer
Sai Krishna Rallabandi har tillbringat åtta månader på att förstå vad som går fel när man tar en AI-agent från att jobba för en person och placerar den i en gruppchatt eller på smarta glasögon. Det största problemet är att agenten måste hålla koll på vem som sa vad under långvariga samtal utan att slösa på tokens, och den måste förhindra att information läcker mellan användare. Han visar att två säkra funktioner kan blir osäkra tillsammans, och hans lösning är att låta agenten läsa allt, skapa väktare, sedan trimma en mindre modell med personliga filter som bara visar relevant information och stoppar prompt injection-attacker.
30 juli youtube.com
VideoAI Engineer
Lucas Palma från Nubank beskriver hur banken byggt ett verktyg kallat Skill Vector för att kontrollera AI-funktioner — små kodprogrammen som utökar vad AI-modeller kan göra — innan de når utvecklarna. Varje funktion skannas först med automatiska kontroller som söker farliga kommandon, sedan granskas den av en AI-modell för att fånga problem som automatiken missar. Efter att ha kontrollerat över 2000 funktioner på det här sättet hittade de verkliga säkerhetsproblem som matades in i bankens system för hantering av sårbarheter. Nubank kombinerade automatiska skanningar med AI-granskning, men behövde förbättra vägledningen och stoppa utvecklare från att köra okontrollerade funktioner lokalt innan de godkänts.
30 juli youtube.com
VideoAI Engineer
Kepler har byggt ett system för att göra AI pålitlig för finansbranschen. Utgångspunkten är att språkmodeller är bra på att gissa nästa ord, men dåliga på exakt matematik som finansvärlden faktiskt behöver. Istället för att låta modellen göra allt själv omger Kepler den med ett system där varje tal måste kunna spåras tillbaka till sin källa, modellen bara gör de saker den är bra på, och alla siffror granskas innan de används. På det sättet blir systemet pålitligt för finansiell data istället för att bara producera innehål som låter bra.
29 juli youtube.com
VideoAI Engineer
En forskargrupp jämförde ett tusentals riktiga människors svar på marknadsundersökningar med AI-agenter som spelade samma roll. Agenterna matchade människorna väl men utan mänsklig variation — och små ändringar i prompten (instruktionen) fick köpbesluten att svänga kraftigt, eftersom modellen gissade på dolda samband som aldrig nämndes. Problemet är att en modell kan se rätt ut i genomsnitt men samtidigt förvränga minorietsgrupper och dölja den variation som faktiskt spelar roll. Lösningen är att först jämföra människor mot människor för att veta vilket överensstämmelse som ens är möjligt, sedan döma de syntetiska personorna mot den gränsen — och viktigast: behandla dem som ekonomiska aktörer som måste valideras mot verkliga resultat innan de påverkar ett beslut.
29 juli youtube.com
VideoAI Engineer
Udi Menkes från Intuit förklarar varför vanliga AI-modeller inte förstår ekonomi och pengar på ett djupt sätt. De kan ge flytande svar på finansiella frågor, men fattar inte det unika i din verksamhet eller vad som hände när liknande företag gjorde samma beslut. Intuits egna finansiella AI-modeller är tränade på data från över 100 miljoner kunder och presterar bättre än generella modeller samtidigt som de är snabbare. Menkes diskuterar hur verklig ekonomisk intelligens går längre än att bara rapportera vad som hänt — den ska hjälpa dig att fatta bättre beslut, eller t.o.m. fatta dem åt dig.
29 juli youtube.com
VideoAI Engineer
Nubank, som betjänar 135 miljoner kunder, använde simulerad träning för att skicka fem AI-agenter till produktion 20 gånger snabbare än tidigare. Problemet var att det tog långt tid att testa agenter — man behövde verklig data från kundsamtal som var långa och kontextberoende, inte bara enkla frågor och svar. Snowglobe löste det genom att generera simulerade kundsamtal automatiskt, med realistiska detaljer som kundkonto, tonfall och syfte. Denna metod fungerade tillräckligt väl — simulerade samtal stämde överens med riktiga i cirka 80 procent av fallen — för att låta Nubanks team testa agenter snabbt och iterera utan att vänta på feedback från produktionen.
29 juli youtube.com
VideoAI Engineer
En skill är en möjlighet du ger en AI-agent — i grunden en kort fil (skill.md) med ett namn och en beskrivning som fungerar som routningsignaler för att agenten ska välja rätt verktyg. På små skalor räcker det med en enkel register, men när systemet växer — över tio skills behövs sökning och embeddings, över hundra behövs faktisk styrning med ägarskap, tester och granskning. Det viktigaste är att skills utan tester börjar fungera dåligt när nya modeller släpps, och på enterprise-nivå är det minst lika viktigt att styra och granska skills som att skriva dem.
29 juli youtube.com
VideoAI Engineer
Morgan Stanley har byggt AlphaLab, ett system med flera AI-agenter som tillsammans löser forskningsproblem. Du beskriver problemet på vanlig engelska, och systemet skriver kod, kör tester, hanterar beräkningsjobb och gör statistiska analyser helt på egen hand. En strategiagent föreslår experiment och arbetaragenter kör dem, allt presenterat på ett kortformat som människor kan läsa och godkänna innan systemet optimerar. Morgan Stanley öppensourcade det och använder det redan internt för att hitta verkliga förbättringar inom områden som modeller och kreditprognos.
29 juli youtube.com
BloggGoogle DeepMind
Google DeepMind lanserar Lyria 3.5, en uppdaterad AI-modell för musikskapande i Google Flow Music. Modellen förbättrar melodistrukturer, textgenerering, vokaluttryck och ger bättre kontroll över tempo och längd på låtarna.
29 juli deepmind.google
VideoAI Engineer
Videon handlar om fel som uppstår inte i AI-modellen själv utan i systemet omkring den — det som kallas "harness failures". Problemet är att agenter kan svara självsäkert från gammal data medan två processer skriver över varandra utan att krascha, eller när ett verktyg anropas men aldrig får svar. Lösningen är att se det som: modellen föreslår, systemet genomför, och en kvittans bevisar att det faktiskt hände. Föreläsaren visar vanliga misstag som felaktig tillåelse, saknade deadlines och state som aldrig sparas, och presenterar fem frågor man bör ställa för varje incident: vad startade det, vilken state ärvde det, vilken behörighet användes, vad kördes, och vilken bevis finns kvar.
29 juli youtube.com