OpenAI sågar kodningsbenchmarken SWE-Bench Pro – ungefär 30 procent av uppgifterna trasiga
OpenAI har granskat SWE-Bench Pro, ett av de mest använda testerna för att mäta AI-modellers förmåga att koda – och drar tillbaka sin tidigare rekommendation att använda det. Enligt den nya granskningen är ungefär 30 procent av uppgifterna i testet trasiga på något sätt.
Ett ”benchmark” är i praktiken ett standardiserat test som används för att jämföra olika AI-modellers prestanda på ett rättvist sätt. OpenAI flaggade tidigare i år liknande problem i föregångaren SWE-bench Verified, och rekommenderade då att branschen skulle byta till SWE-Bench Pro istället – ett test byggt för att mäta mer realistiska, långsiktiga kodningsuppgifter hämtade från verkliga kodbaser. På testets 731 offentliga uppgifter förbättrades de bästa modellernas träffsäkerhet från 23,3 till 80,3 procent på bara åtta månader – en imponerande siffra som nu delvis ifrågasätts.
För att kontrollera kvaliteten byggde OpenAI en granskningsprocess i flera steg: ett automatiskt filter flaggade 286 potentiellt problematiska uppgifter, som sedan granskades dels av AI-agenter som fick undersöka kodbasen och testfallen på djupet, dels av fem erfarna mjukvaruutvecklare per uppgift. De två granskningsspåren identifierade fyra typer av återkommande fel: alltför strikta tester som kräver en specifik lösning även när uppgiften inte kräver det, otydliga instruktioner som utelämnar krav som de dolda testerna ändå kontrollerar, tester med för dålig täckning som släpper igenom ofullständiga lösningar, samt direkt missvisande instruktioner som pekar modellen åt fel håll.
Ett konkret exempel gäller en uppgift om att formatera innehållsförteckningar till Markdown. Instruktionen till modellen visade exempel med ett mellanslag mellan vissa tecken, men de dolda testerna som faktiskt avgjorde om lösningen godkändes krävde två mellanslag. En modell som följde instruktionen till punkt och pricka riskerade alltså att bli underkänd – inte för att den gjorde fel, utan för att testet och uppgiftsbeskrivningen motsade varandra.
OpenAI drar nu tillbaka sin tidigare rekommendation av SWE-Bench Pro och efterlyser nya benchmarks byggda direkt av erfarna utvecklare, med bättre mänsklig kvalitetskontroll genom hela processen. Poängen är bredare än ett enskilt test: om testerna som används för att mäta AI:ns förmågor innehåller fel, riskerar både forskning och säkerhetsbedömningar att bygga på en skev bild av vad modellerna faktiskt klarar.
Källa: OpenAI, ”Separating signal from noise in coding evaluations”, 8 juli 2026. https://openai.com/index/separating-signal-from-noise-coding-evaluations


Publicera kommentar