Microsoft bouwt zijn nieuwe beslismodel op het Chinese Qwen3.5
Een model dat geen tekst schrijft
Microsoft heeft een eigen decision model uitgebracht: Microsoft-Decision-1. In de aankondiging van donderdag legt Achint Srivastava, VP of Software Engineering in het Office of the CTO, uit waarin zo'n model verschilt van een gewone LLM. Een taalmodel is gebouwd om tekst te genereren of ergens over te redeneren; een beslismodel levert alleen gestructureerde uitvoer waar software direct mee verder kan.
Concreet: je geeft het model een vaste set antwoordopties, en het geeft per optie een gekalibreerde kans terug. Het ondersteunt ja/nee-vragen, meerkeuze, scores en het beoordelen van AI-antwoorden of agent-acties aan de hand van een rubric. Microsoft noemt als toepassingen het routeren van verzoeken naar het juiste model, classificatie, prioritering, en het beslissen of een agent zijn volgende stap mag zetten of moet stoppen. Het model is beschikbaar via Microsoft Foundry en volgens Microsoft binnenkort via OpenRouter.
De basis komt van Alibaba
Het opvallendste detail staat in de technische toelichting: Microsoft-Decision-1 is een nagetraind Qwen3.5-9B. Dat model komt uit de Qwen-familie van Alibaba Cloud, de clouddivisie van het Chinese Alibaba. Microsoft schrijft zelf dat het de Decision-1 "binnenkort" gaat herbaseren op andere modellen, waaronder die van Microsoft AI (MAI) en van OpenAI. Waarom, zegt het bedrijf niet. The Register wijst erop dat Microsoft daarmee niet alleen staat: het H2O-Lightning-4B van H2O.ai is gebouwd op Qwen3.5-4B.
Wat Microsoft claimt
De cijfers in de aankondiging komen uit Microsofts eigen benchmarks, dus lees ze als zodanig. Het bedrijf zegt zijn model te hebben getest op 36 benchmarks met bijna 150.000 vragen die buiten de trainingsdata zijn gehouden, en daar de hoogste nauwkeurigheid te halen. Op latency noemt Microsoft het model 2,5 keer sneller dan H2O-Lightning-4B v1.1 — de nummer twee in de eigen test — en 35 keer sneller dan GPT-6 Sol op P50-latency.
Twee andere claims zijn interessanter dan de snelheidsrecords. Robuustheid: Microsoft varieerde hetzelfde verzoek op acht manieren (geparafraseerde opties, omgekeerde volgorde, andere sleutels, opmaakruis) en meet dat de beslissing in gemiddeld 1,3 procent van de gevallen omslaat, met nul omslagen bij geherformuleerde of herschikte opties. En kalibratie: de kans is onderdeel van de API, niet slechts een rangordescore, zodat een voorspelling van 90 procent ook ongeveer negen van de tien keer moet kloppen.
Intern test Microsoft het model al. Xbox Research sorteerde er meer dan 10.000 stukken open feedback mee in vaste thema's en vond het qua kwaliteit vergelijkbaar met GPT-6 Sol, maar ruim 14 keer sneller en 200 keer goedkoper. The Register noemt een prijs van 0,042 dollar per miljoen invoertokens, met gratis uitvoertokens, en een nauwkeurigheid van 83,5 procent over die 36 benchmarks.
Een plotseling vol marktsegment
De timing is geen toeval. Volgens The Register begon de categorie te lopen na Jev van TypeSafe AI, en haastten daarna tientallen partijen zich met een eigen beslismodel: OpenAI met een Decisions API in publieke bèta, Cloudflare, Liquid AI, Perplexity, Snowflake en H2O.ai. Er zouden er inmiddels meer dan honderd zijn. Dat classifiers met kansuitvoer technisch al jaren bestaan, maakt het verschil niet: de verpakking als los, snel en goedkoop API-onderdeel is wat nu verkoopt.