Benchmarkplatform Arena vergeleek tienduizenden antwoorden van Opus 5 en Opus 5.5: het gedachtestreepje verdwijnt bijna, zinnen worden korter, maar de antwoorden zelf worden langer.
Een onderzoeksmodel van OpenAI bereikte vanuit een afgesloten trainingsomgeving een externe chatbot door vragen als DNS-queries naar buiten te sturen. Alle training en tool-gebruik van de krachtigste modellen ligt stil.
Microsoft voegt chat, een low-code bouwomgeving op basis van GitHub Copilot en altijd doorlopende agents samen in één Copilot-app. Voor beheerders is de licentiewijziging het belangrijkste nieuws: agentwerk wordt per gebruik afgerekend in plaats van per gebruiker per maand.
Het interne onderzoek van OpenAI naar afwijkend agentgedrag levert nieuwe incidenten op: 53 gebruikersafbeeldingen belandden op publieke hostingsites en modellen haalden gegevens op bij de SEC en het Census Bureau. Onderzoeksinstituut Transluce meldt een mislukte hackpoging op een onderwijsministerie-site.
Akamai levert Anthropic zeven jaar lang cloudcapaciteit voor 11,6 miljard dollar. Opvallend: het gaat om CPU-werk, niet om GPU's. Anthropic krijgt daarnaast een warrant op bijna vijf procent van Akamai.
Een AI-agent van OpenAI kwam in juni ongeoorloofd in een portaal met Medicare-statistieken. Premier Albanese noemt het onacceptabel en verwijt OpenAI dat het drie maanden duurde voor de melding kwam.
Cisco Talos beschrijft de eerste publiek gedocumenteerde Windows-malware die zijn command-and-control uitbesteedt aan taalmodellen. Gemini, DeepSeek, Qwen en Mistral stemmen over wat het implant vervolgens doet.
OpenAI heeft twee lichtere GPT-6-varianten uitgebracht. Sol en Luna mikken niet op de hoogste score maar op de kosten per taak, met API-prijzen die de helft lager liggen dan bij de GPT-5.6-generatie.
Anthropic heeft Claude Opus 5.5 uitgebracht, het eerste model in de Claude 5.5-familie. Het presteert volgens het bedrijf op het niveau van Fable 5.1, maar kost 40 procent minder om te draaien.
Fable 5 en Mythos 5 zijn hetzelfde model. Het verschil zit volledig in de beveiliging. Een blik op de classifiers, het uplift-probleem en Project Glasswing.
Anthropic lanceerde op 9 juni Claude Fable 5 en Mythos 5, een nieuwe modelklasse boven Opus. State-of-the-art op vrijwel alle benchmarks, met ingebouwde veiligheidsclassifiers.
Claude, GPT, Gemini, Llama — ze overlappen sterk maar zijn het niet. Mijn persoonlijke kijk op de vier grote modelfamilies: waar ze goed in zijn, waar ik tegenaan loop, en hoe ik kies.
Tool use is het moment waarop een LLM stopt met praten en iets daadwerkelijk doet. Hoe het technisch werkt, wat je kunt verbinden, de relatie met agents en MCP, en welke risico's je in de gaten houdt.
Het model weet niet wat jij weet. RAG is de oplossing: relevante documenten ophalen en aan het model geven voordat het antwoord genereert. Hoe het technisch werkt, wanneer je het gebruikt, en hoe ik het in mijn eigen setup toepas.
AI verzint soms dingen die overtuigend klinken maar niet kloppen. Niet omdat het liegt, maar omdat het zo werkt. Drie typen hallucinaties, wanneer het meest voorkomt, en hoe ik er in de praktijk mee omga.
Niet wat MCP is, maar wat ik er zelf mee doe: drie servers die ik dagelijks draai, wat ik bewust niet verbind, en wat ik heb geleerd over permissies en grenzen trekken.
Het woord 'agent' duikt overal op, maar wat is het precies? Geen chatbot, geen script. Een systeem dat een doel krijgt en zelfstandig stappen zet — inclusief tools gebruiken, beslissingen nemen en bijsturen als het misgaat.
Geen uitleg over wat Claude Code is, maar hoe het bij mij dagelijks werkt: een persoonlijke wiki beheren, een portfolio-briefing draaien en webapps bouwen zonder developer te zijn.
Alles wat een taalmodel ziet staat in het context window. Wat tokens zijn, waarom output duurder is dan input, hoe een system prompt verschilt van een user message, en wat er gebeurt als het window vol raakt.