Gemini 3.5 Flash får styra datorn själv

Google har bakat in datorkontroll i Gemini 3.5 Flash, så att modellen kan se och styra skärmar, webbläsare och mobiler på egen hand. På OSWorld-testet hamnar den i nivå med GPT-5.5.

NYHET

Gemini 3.5 Flash får styra datorn själv

Funktionen som tidigare krävde en separat modell sitter nu direkt i Flash.

1UP · GENERERAD GRAFIK

Google har integrerat funktionen “Computer Use” direkt i Gemini 3.5 Flash, vilket innebär att modellen själv kan se, förstå och agera i datorer, webbläsare och mobiler. Tidigare fanns möjligheten bara som en separat modell byggd på Gemini 2.5. Nu sitter den i Flash, tillsammans med befintliga verktyg som funktionsanrop, sökning och kartor.

För utvecklare betyder det att man kan bygga agenter som arbetar tvärs över webbläsare, mobil och skrivbordsmiljö. Google pekar på användningsområden som mjukvarutestning och kontorsautomatisering, alltså uppgifter där en modell behöver klicka, fylla i fält och navigera precis som en människa skulle göra.

Hur bra presterar modellen jämfört med konkurrenterna?

På OSWorld, ett vedertaget test för just den här typen av datorstyrning, får Gemini 3.5 Flash 78,4 poäng. Det slår både Gemini 3 Flash på 65,1 och GPT-5.4 mini på 72,1. GPT-5.5 ligger snäppet före på 78,7, medan Anthropics Opus 4.8 leder fältet med 83,4. Sonnet 4.6 landar på samma 78,4 som Flash, och Gemini 3.1 Pro på 76,2.

Siffrorna är värda att läsa nyktert. Att en snabb och billigare Flash-modell hamnar i nivå med de tyngre konkurrenterna på det här testet är intressant, men ett enskilt benchmark säger inte allt om hur en agent beter sig i verkliga, röriga arbetsflöden. Kontrollera aktuella uppgifter, modellerna och deras resultat uppdateras i snabb takt.

Hur hanterar Google säkerheten?

Att låta en modell ta kontroll över en webbläsare väcker direkt frågan om vad som händer när någon försöker lura den. Den största risken heter prompt injection, alltså att skadliga instruktioner göms i en webbsida eller ett dokument som modellen läser.

Google säger sig möta detta på flera sätt. Modellen är tränad mot den typen av attacker, och för företagskunder finns två valfria skydd. Det ena kräver att användaren bekräftar känsliga eller oåterkalleliga åtgärder innan de utförs. Det andra stoppar automatiskt en uppgift om systemet upptäcker indirekta injektionsförsök. Utöver det rekommenderar Google sandboxning, mänsklig översyn och strikt åtkomststyrning.

Funktionen är tillgänglig via Gemini API och företagsplattformen Gemini Enterprise Agent Platform. Google hänvisar också till en demo via Browserbase och en referensimplementation på GitHub för den som vill testa.

1up:s läsning

Det mest talande här är inte poängen på ett enskilt test, utan att datorstyrning flyttar från en specialmodell rakt in i en standardmodell som Flash. När en av de billigare och snabbare modellerna får den här förmågan blir agenter som klickar runt i riktiga gränssnitt något man kan bygga in i vanliga produkter. Det är skillnaden mellan en dyr labbleksak och något som faktiskt får plats i en budget.

Samtidigt är säkerhetsbiten den intressanta brytpunkten. En modell som får styra din webbläsare är lika mycket en attackyta som ett verktyg, och att Google placerar skydden mot prompt injection som valfria företagsfunktioner snarare än standard säger något om hur tidigt vi fortfarande är. Funktionen är här, men förtroendet får byggas i takt med att den används skarpt.