I ett praktiskt kodtest som Snowflake genomfört hamnade den kinesiska modellen GLM-5.2 i princip jämsides med Anthropics Claude Opus 4.7. När båda fick tre försök per uppgift löste de 66 respektive 67 procent av problemen, enligt rapporteringen. Skillnaden i resultat var alltså marginell, medan skillnaden i pris är allt annat än det.
Testet omfattade 103 uppgifter där modellerna skulle skriva kod som fungerar både på DuckDB och Snowflake. GLM-5.2 kommer från kinesiska Zhipu AI och beskrivs av Snowflakes vd Sridhar Ramaswamy som riktigt vass på just en sak: att validera kod tillförlitligt mot båda plattformarna samtidigt. Det var enligt honom anledningen till att enbart GLM klarade vissa uppgifter över huvud taget.
Hur stor är skillnaden mellan modellerna?
Opus 4.7 är den bättre modellen, men inte med stor marginal. På första försöket träffade Opus rätt i 53,7 procent av fallen mot GLM:s 47,6 procent, vilket pekar på att den kinesiska modellen är mindre konsekvent. Opus är också effektivare. GLM behövde i snitt 99 körningar per uppgift mot Opus 80, och förbrukade nästan dubbelt så många tokens totalt, runt 860 miljoner mot 439 miljoner.
GLM:s svaghet är enligt Ramaswamy att den ger upp för tidigt och fastnar i att kontrollera fel saker. På en uppgift avlossade modellen 411 verktygsanrop på 24 minuter, kollade radantal, fördelningar och kolumntyper, och misslyckades ändå alla tre försöken. Opus löste samma uppgift med 49 anrop på nio minuter. Påståendet att GLM skulle producera renare kod höll alltså inte, menar han. Fler kontroller gav inte fler korrekta resultat.
Varför sätter priset press på de västerländska labben?
Det är här nyheten blir allvarlig för Anthropic och OpenAI. GLM-5.2 ska enligt Zhipus officiella prislista kosta 1,40 dollar per miljon input-tokens och 4,40 dollar per miljon output-tokens, och vissa tredjepartsleverantörer uppges underskrida det ytterligare. Claude Opus 4.7 ligger på 5 respektive 25 dollar, och GPT-5.5 på 5 respektive 30 dollar. Den högre tokenförbrukningen äter upp en del av prisfördelen, men gapet är fortfarande stort. Kontrollera aktuella uppgifter, AI-priser ändras ofta.
Pressen biter dessutom mitt i kodning, just det användningsområde som båda de västerländska labben satsat hårdast på. Snowflake-teamet säger sig vilja göra GLM-5.2 tillgänglig för sina kunder.
1up:s läsning
Det intressanta är inte att en kinesisk modell är billig. Det är att den är billig och nästan lika bra på flaggskeppsuppgiften, mätt i ett verkligt test hos ett stort företag snarare än i en städad benchmark. Värderingarna av OpenAI och Anthropic vilar på antagandet att intäkterna fortsätter klättra snabbt, och de antagandena är i sin tur knutna till enorma satsningar på datacenter och chip.
Samtidigt är det ett enskilt test, på en specifik typ av databasarbete, från ett företag med egna kommersiella skäl att lyfta fram en billigare modell. Opus vann fortfarande på effektivitet och förstaförsöksprecision. Värt att följa noga, men ännu inte ett kvitto på att kartan ritats om.