USA
Derfor taler alle pludselig om modeldistillering
Modeldistillering lyder som et smalt teknisk begreb. Alligevel er metoden nu blevet et af de nyeste stridspunkter i AI-kapløbet mellem USA og Kina.
Årsagen er, at teknikken kan gøre avanceret AI billigere og mere effektiv. Den kan også hjælpe mindre systemer med at lære udvalgte evner fra større modeller.
Det er netop den mulighed, der nu skaber bekymring blandt amerikanske AI-selskaber.
En mindre model lærer af en større
I modeldistillering bruger man en stor AI-model som lærer. Den genererer output, eksempelvis svar eller kode, som derefter bruges til at træne en mindre model.
Den mindre model bliver ikke en direkte kopi. Den overtager ikke den store models arkitektur, vægte eller fulde kapacitet.
I stedet lærer den bestemte måder at løse opgaver på. Resultatet kan være en model, der er billigere at bruge og lettere at udrulle til bestemte formål.
Læs også:
Billigere AI kan få stor betydning
Store frontiermodeller kræver store datacentre, dyre chips og betydelige investeringer. Distillerede modeller kan i nogle tilfælde køre med færre ressourcer.
Det gør dem attraktive for virksomheder og regeringer, der vil bruge AI bredere.
Mindre modeller kan målrettes konkrete opgaver og bruges i tekniske miljøer, hvor de største modeller ikke er praktiske eller økonomisk oplagte.
Hvorfor reasoning traces betyder noget
Interessen for distillering er vokset i takt med, at AI-systemer ikke kun leverer svar, men også kan vise trin på vejen frem mod svaret.
Disse trin kaldes reasoning traces. De kan give en mindre model mere brugbar træning, fordi den lærer selve fremgangsmåden.
Florian Tramèr fra ETH Zurich siger ifølge Reuters: “If I give you a book of complicated math problems with final solutions, you will have a much harder time learning how to solve problems than if I gave you detailed solutions that describe all steps to take.”
Dermed bliver AI-output mere følsomt. Det handler ikke længere kun om svaret, men også om den måde svaret bliver til på.
Teknikken er ikke ny
Distillering er ikke en ny eller i sig selv forkert praksis.
Amerikanske projekter som Stanford Universitys Alpaca og Microsofts Orca har brugt output fra stærkere modeller til at forbedre mindre systemer. Kinesiske forskere har også brugt output fra amerikanske modeller i offentlige forskningsprojekter.
Det omstridte punkt er, om lukkede modeller bliver brugt på måder, som selskaberne bag dem ikke har givet tilladelse til.
Lukkede modeller gør forskellen
Åbne modeller giver forskere adgang til at inspicere og ændre underliggende parametre.
Lukkede modeller fungerer anderledes. ChatGPT fra OpenAI og Claude fra Anthropic forbliver under selskabernes kontrol og bruges normalt gennem proprietære grænseflader eller API’er.
Det gør adgang til output til et centralt spørgsmål.
Den nye AI-front mellem USA og Kina
Anthropic har beskyldt kinesiske aktører, blandt andre DeepSeek, Moonshot og MiniMax, for omfattende forsøg på at få evner ud af Claude-modeller.
Selskabet har peget på områder som software engineering og avanceret ræsonnement. OpenAI har også sagt, at det har opdaget forsøg fra kinesiske aktører på at bruge dets modeller til distilleringsrelaterede formål.
Reuters skriver, at ingen kinesiske selskaber hidtil har beskyldt amerikanske rivaler for at distillere lukkede modeller.
En velkendt metode med ny betydning
Modeldistillering viser, hvordan et teknisk forskningsværktøj kan få geopolitisk betydning.
Når små modeller kan lære udvalgte evner fra store systemer, bliver spørgsmålet om adgang afgørende.
Derfor er distillering ikke længere kun et spørgsmål for AI-laboratorier. Det er blevet en del af kampen om, hvem der kontrollerer fremtidens mest værdifulde AI-evner.
Læs også: