Jarvis Engine kiest per vraag automatisch het AI-model dat het beste past, met oog voor kwaliteit, kosten, snelheid en de privacy van gegevens.
Veel AI-toepassingen sturen elke vraag naar één groot taalmodel in de cloud. Dat is eenvoudig, maar niet elke vraag vraagt evenveel denkkracht. Een tekst samenvatten of een e-mail sorteren kan vaak prima met een kleiner model. Wie alles naar het grootste model stuurt, betaalt meer en wacht langer dan nodig.
Een vraag aan een AI-model kan persoonsgegevens, bedrijfsinformatie of broncode bevatten. Bij een clouddienst worden die gegevens buiten de eigen organisatie verwerkt. Een model dat op eigen computers draait, een lokaal model, houdt ze binnen de deur. Dat is niet automatisch veiliger, maar geeft wel meer controle.
De keuze voor een model gaat daarom ook over welke gegevens waar verwerkt mogen worden. Een vraag met gevoelige gegevens gaat bijvoorbeeld alleen naar een lokaal model. Een lastige vraag zonder gevoelige gegevens mag naar het krachtigste cloudmodel.
Wie volledig op één aanbieder leunt, merkt het direct als die de prijzen verhoogt, de dienst aanpast of tijdelijk onbereikbaar is. Als modellen uitwisselbaar zijn, kan het systeem bij problemen overstappen naar een ander model.
Meerdere modellen betekent ook meer complexiteit. Het systeem moet keuzes maken, fouten opvangen en verschillende modellen op dezelfde manier aansturen. Lokale modellen vragen bovendien om eigen hardware en onderhoud. Of de voordelen opwegen tegen die extra moeite, is precies wat dit project onderzoekt.
De projectgroep onderzoekt, ontwerpt, bouwt en test een systeem dat meerdere AI-modellen beheert: kleine modellen op eigen hardware, grotere open modellen en krachtige cloudmodellen. Voor elke binnenkomende vraag kiest het systeem het best passende model. Daarbij kan het letten op:
“Welk model of welke aanpak past het best bij deze specifieke vraag?”
Eerst vergelijkt de groep bestaande modellen aan de hand van wetenschappelijke literatuur en openbare testresultaten. Doet een klein model een taak bijna even goed als een groot model, dan kan die taak goedkoper of lokaal worden afgehandeld. Eigen tests volgen alleen waar dat nodig is.
Daarna wordt uitgezocht hoe het systeem automatisch kiest. Eerst gelden de vaste regels: mogen gegevens niet naar buiten, dan vallen cloudmodellen af. Uit de overgebleven modellen kiest het systeem op kwaliteit, snelheid en kosten.
Ook samenwerking tussen modellen wordt onderzocht. Bijvoorbeeld eerst een klein model proberen en alleen bij twijfel doorschakelen naar een groter model, of een tweede model het antwoord laten controleren.
Het systeem wordt zo gebouwd dat modellen eenvoudig toegevoegd of vervangen kunnen worden, zonder de rest opnieuw te bouwen. Foutafhandeling, het bijhouden van wat er gebeurt en een reservemodel bij uitval horen daarbij.
De projectgroep heeft nu geen krachtige computers om meerdere modellen lokaal te draaien. Eerst wordt bepaald hoeveel rekenkracht echt nodig is. Daarna worden de opties vergeleken: hardware via de Hanze, gehuurde rekenkracht in de cloud, de computers van de projectleden samen, of een combinatie daarvan.
Een systeem dat gevoelige gegevens naar het verkeerde model stuurt, is zelf een risico. Daarom zijn toegangsbeheer, het herkennen van gevoelige gegevens, veilige verbindingen en de bescherming van wachtwoorden en sleutels onderdeel van het ontwerp.
Tot slot wordt Jarvis Engine vergeleken met de eenvoudige aanpak: alles naar één krachtig model. Daarbij wordt gekeken naar kwaliteit, kosten, snelheid, betrouwbaarheid en het naleven van de privacyregels. Zo wordt duidelijk in welke situaties meerdere modellen meerwaarde hebben en hoe je zo’n systeem veilig en betrouwbaar bouwt.
Een AI-assistent laat zien hoe de engine werkt. De kern van het project is de techniek erachter: het systeem dat bepaalt welk model waar en wanneer wordt ingezet.
Bekijk alle projecten van CollabSpace of de andere opdrachten binnen de WBP-specialisatie.