Digitale autonomie begint lokaal: hoe KdG een eigen rekencluster bouwde
Een eigen rekencluster opzetten? Dat klinkt als iets voor grote universiteiten of techreuzen. Niet voor een hogeschool zonder HPC-ervaring. Toch is dat exact wat ze bij Karel de Grote Hogeschool gedaan hebben. Onderzoekers van het expertisecentrum Duurzame Industrie gingen zelf aan de slag, met reden: meer controle, lagere kosten én digitale autonomie. Wat begon als een sprong in het diepe, groeit stilaan uit tot een stevig fundament voor AI-onderzoek, samenwerking en onderwijs.
Waarom KdG als 'beginners' toch kozen voor een eigen rekencluster
Aan de Karel de Grote Hogeschool werken we binnen het onderzoekcentrum Duurzame Industrie veel aan data-intensieve projecten. Tot nu toe gebruikten we vooral gewone werkstations of cloudoplossingen. Maar we liepen steeds meer aan tegen beperkingen in schaalbaarheid, samenwerking en controle. Zo was werken vanuit remote desktops, op een workstation met meerdere gebruikers, niet ideaal. Het stockeren van grote, groeiende, datasets in de cloud komt echter ook met flink prijskaartje. Daarom besloten we, ondanks onze beperkte ervaring met high-performance computing (HPC), de sprong te wagen: een eigen rekencluster opzetten. We deden hiervoor beroep op de subsidie ‘Onderzoeksinfrastructuur voor hogescholen’ van VLAIO.
Waarom HPC?
Onze onderzoekers en studenten hebben almaar meer nood aan rekencapaciteit, zeker in projecten rond artificiële intelligentie, grote taalmodellen (Large Language Models, LLM’s) en simulatie. Daarnaast merkten we dat samenwerken aan data en modellen nood heeft aan gedeelde infrastructuur. Een infrastructuur die ervoor zorgt dat iedereen in dezelfde omgeving werkt, zonder afhankelijk te zijn van eigen hardware.
Lokale infrastructuur biedt ons bovendien meer controle. We kunnen beter toezien op hoe en waar data worden opgeslagen en verwerkt, wat belangrijk is voor privacy en regelgeving. Het geeft ons ook meer grip op kosten op de lange termijn: eens de investering is gedaan, kunnen we lang gebruik maken van de middelen met voorspelbare supportkosten, zonder variabele traffic en tarieven waar we geen controle over hebben.
Iets wat we ons absoluut nog niet realiseerden toen we begonnen, is hoe belangrijk digitale autonomie zou worden voor Europa. AI evolueert snel en niemand weet waar het zal eindigen. Wel wordt duidelijk dat AI voor organisaties als de onze een kernbehoefte zal worden. Steeds meer processen zullen aangestuurd worden door AI-modellen, waardoor rekencapaciteit dus een strategische hulpbron wordt.
Combineer dat met het feit dat veel commerciële AI-providers hun diensten voorlopig kunnen aanbieden dankzij grote investeringen van durfkapitalisten – middelen die niet oneindig zijn – en het wordt duidelijk dat afhankelijkheid van deze partijen risico’s inhoudt. De gebruikskosten van AI-modellen in de cloud zouden in de toekomst wel eens veel hoger kunnen liggen. In dat licht geeft een eigen cluster toch een zekere mate van gemoedsrust.
Maar... waarom niet gewoon in de cloud?
Een terechte vraag. De cloud is zonder twijfel de standaardkeuze voor wie snel wil starten of tijdelijke projecten uitvoert. Ook voor specifieke toepassingen kan de cloud voordeliger zijn, zeker bij lage of onregelmatige belasting.
Puur economisch gezien zal je al een flinke behoefte aan rekenkracht moeten hebben om een overstap te rechtvaardigen. Naar ons inzien is een rekencluster echter niet iets waar je voor kiest om louter kosten te besparen. Een cruciaal inzicht is bijvoorbeeld het begrijpen van wat er écht gaande is bij een rekenjob en waar de bottlenecks liggen. Ook privacy en databeheer vormen een uitdaging, zeker bij gevoelige datasets zoals medische gegevens (denk aan GDPR/AVG-vereisten). Tot slot wilden we samenwerken met studenten of collega’s eenvoudiger maken door een gedeeld platform met centrale login en toegang tot lokale data.
Voor ons was de keuze dus geen afwijzing van de cloud, maar een bewuste keuze om lokaal te starten waar dat meerwaarde biedt.
Waarom als groentjes toch zelf beginnen?
We zijn geen HPC-experts, maar net dat maakte het voor ons interessant om de infrastructuur zelf op te zetten. Er is steeds meer open-source software en kennis beschikbaar. Daarnaast is er in Vlaanderen een sterke community voor HPC in de vorm van het Vlaams Supercomputer Centrum.
Dankzij een VLAIO onderzoeksinfrastructuuraanvraag konden we starten met een aanbesteding voor de plaatsing van de rekencluster. Zo kwamen we uit bij Clustervision als HPC-leverancier, waarmee we in gesprek onze rekenbehoeftes hebben omgezet naar de specificaties van het cluster. In ons geval was dat een cluster met een nadruk op GPU's (grafische processors). Daarbij hebben we in de beginperiode bewust gekozen voor uitgebreide ondersteuning in de vorm van remote system administration. Zo kunnen we rekenen op een stabiele werking, terwijl we tegelijk de tijd nemen om intern de nodige kennis op te bouwen. Op die manier groeien we stap voor stap in onze rol als systeembeheerder.
Die tijd is hard nodig, want er is wel degelijk een flinke leercurve: van het configureren van job scheduling, gebruikers beheer, Single Sign On, Jupyter Notebooks, integratie in het KdG-netwerk tot firewallinstellingen.
De eerste toepassing: ExplainMed
Eén van de eerste projecten op onze cluster was ExplainMed. In dit project passen we AI toe op medische data. Omdat het om gevoelige gegevens gaat, was het een groot voordeel dat we konden rekenen op een eigen infrastructuur: data blijft lokaal en we hebben controle over toegang en logging. Het trainen van een eerste volledig AI-model op ons cluster, in plaats van ons te beperken tot fine-tuning, voelde als een echte mijlpaal.
Daarnaast gebruiken we de cluster voor interne AI-trainingen, het testen van parallellisatie, simulaties en studentprojecten die baat hebben bij meer rekencapaciteit dan hun laptop kan bieden.
Wat we geleerd hebben (tot nu toe)
De grootste complexiteit zit niet in de hardware, maar in de softwarestack: gebruikersbeheer, job scheduling, monitoring, logging, veiligheid, updates... Het vergt intensieve samenwerking tussen IT, onderzoekers en onze HPC-leverancier.
We leerden dat goede documentatie en gebruikersondersteuning essentieel zijn. Een cluster is pas waardevol als mensen er vlot mee kunnen werken. Daarom investeren we in korte handleidingen en uitgebreide documentatie. Het begrijpen van een systeemarchitectuur is ook een meerwaarde die we onze studenten en onderzoekers willen meegeven, waardoor ze later ook de cloud begrijpen.
Ons belangrijkste inzicht? Begin klein. Test een paar typische workflows of de belangrijkste use case. Voor ons was dit het kunnen aanbieden van Jupyter Notebooks in de browser en een container runtime. Probeer eens een kleine LLM te trainen. Lukt dat? Probeer het eens met meerdere GPU’s en nodes, enzovoort. Laat gebruikers feedback geven. Groeien kan altijd.
Investeer in tooling. Plug-ins voor je IDE kunnen een hoop tijd op je command line besparen. Met de juiste tooling hoeft HPC-toegang hoeft niet moeilijk te zijn en is het alsof je een gewone server benadert.
Wat we nog willen leren/doen
Dit is nog maar aan het begin. We willen onze job scheduling beter afstemmen op verschillende types gebruikers (bv. studenten vs. onderzoekers). Daarnaast willen we tools zoals Matlab en koppelingen met NAS-storage verder uitrollen.
Tenslotte willen we een gebruikerscommunity uitbouwen, met onderlinge uitwisseling van scripts, tips en feedback. HPC is een leertraject en het werkt beter als je het samen doet.
Er zijn veel initiatieven in opkomst rond toegang tot HPC zoals EuroHPC, AI Factories, … Dit belang lijkt almaar groter te worden. Ook voor ons werkveld is de overstap naar HPC-computing nog erg groot. Wij hopen op termijn hierbij te kunnen assisteren, ofwel door toegang tot ons cluster mogelijk te maken of door bedrijven wegwijs te maken in de wereld van HPC.
Slotgedachte
Een eigen rekencluster is geen eindpunt, maar een startpunt. Voor kleine instellingen lijkt HPC soms buiten bereik, maar onze ervaring leert: het is haalbaar én waardevol. Je hoeft geen expert te zijn om te beginnen.
Onze boodschap: begin eenvoudig, durf te leren en werk samen. HPC is niet alleen voor grote universiteiten of instellingen. Hoewel het een flinke investering in mensen en middelen vergt, is het een optie voor elke instelling die met veel nieuwsgierigheid stappen wil zetten in datagedreven onderzoek.
Hoe je van HPC-beginner tot je eigen rekencluster kan gaan
webinar - online - Karel de Grote Hogeschool
Deze blog is met hulp van AI opgesteld.
Remco van Schadewijk
Dr. Remco van Schadewijk (KdG, Onderzoekscentrum Duurzame Industrie) is een interdisciplinair wetenschapper en onderzoeker met een achtergrond in life sciences, data science en wetenschapscommunicatie. Na een doctoraat aan de Universiteit Leiden, waar hij onderzoek deed naar metabolische beeldvorming met MRI, legde hij zich toe op de inzet van data en AI voor industriële innovatie. Hij is momenteel coördinator van de onderzoekslijn Data Science voor de Industrie aan de Karel de Grote Hogeschool in Antwerpen, waar hij projecten leidt rond digitalisering en duurzaamheid. Daarnaast is hij actief in wetenschapscommunicatie, onder meer via educatieve multimedia en onderwijsinnovatie.
Wouter Deketelaere
Wouter Deketelaere is onderzoeker binnen het onderzoekscentrum Duurzame Industrie aan de Karel de Grote Hogeschool. Hij heeft uitgebreide ervaring opgebouwd in zowel het onderwijs als het onderzoek, met een sterke focus op Data Science, Artificial Intelligence (AI), Machine Learning (o.a. Reinforcement Learning en Large Language Models).
Met een Master in Artificiële Intelligentie combineert Wouter diepgaande theoretische kennis met praktische toepassingen. Als docent aan de opleiding Toegepaste Informatica heeft hij vakken rond Data Science en AI ontwikkeld en jarenlang gedoceerd. Nu werkt hij aan het innovatief toepassen van deze technieken binnen diverse onderzoeksprojecten.
Dankzij zijn expertise en ervaring in zowel onderzoek als onderwijs kan Wouter een belangrijke brug slaan tussen deze domeinen. Hij is sterk gericht op het toepassen van onderzoeksresultaten en het vertalen ervan naar concrete, begrijpelijke toepassingen voor diverse doelgroepen, wat bijdraagt aan de verspreiding en implementatie van de projectresultaten.
Gerelateerde opleidingen