Ga verder naar de inhoud
Waarheidsgetrouwheid in databases en AI

Futureproof databeheer

10 okt. 2024 - 19 dec. 2024

Door nieuwe manieren van verzamelen van data en omgaan met data verkrijgen we grotere en complexere databronnen. Deze worden almaar meer aangewend door nieuwe toepassingen en artificiële intelligentie en hebben vaak tot doel om te zorgen voor verbeterde beslissingsondersteuning. De huidige databanktechnologie anticipeert op deze veranderingen maar vraagt bijzondere aandacht voor de waarheidsgetrouwheid van teruggegeven resultaten.

Lees meer & inschrijven ⇗

Praktische info:

10 okt. 2024 - 19 dec. 2024
35 uur
UGain - Technologiepark 60, 9052 Zwijnaarde
Nederlands
Doelgroep: datawetenschappers, data-analisten, software-ontwikkelaars, bedrijfsanalisten, managers, studenten, academici, professionals

Inschrijven?

  • Voorwaarden: enige basiskennis over databanken en AI
  • Prijs: €1600
Lees meer & inschrijven ⇗

georganiseerd door:

De opleiding is gericht op het verwerven van inzicht in de huidige technieken voor databeheer en datagebruik. We leren je de praktische voor- en nadelen van conventionele SQL-databasesystemen en zogenaamde NoSQL-databasesystemen en hoe je deze systemen nuttig samen kan inzetten.
Verder besteden we ruim aandacht aan het efficiënt beheer en gebruik van tekstuele data. Nieuwe technologie zoals vectordatabases en op taalmodellen gebaseerde toepassingen zoals ChatGPT worden toegelicht met bijzondere aandacht voor waarheidsgetrouwheid en praktische inzetbaarheid.

De opleiding wordt georganiseerd onder de vorm van hoorcolleges die afgewisseld worden door praktische demosessies die interactief kunnen worden gevolgd. Deelnemers kunnen vrijblijvend zelf software op hun laptop installeren om bepaalde zaken praktisch uit te testen.

Het gebruik van big data en AI werpt vragen op over waarheidsgetrouwheid (veracity) van resultaten. Mede hierdoor behoren het adequaat inschatten en gepast omgaan met datakwaliteit tot de grootste IT-uitdagingen van organisaties. In deze cursus leer je de aandachtspunten, beperkingen en baten bij het gebruik van de nieuwste databanktechnologie met het oog op waarheidsgetrouwe resultaten. Door bewust te leren omgaan met datakwaliteit kan je data-gedreven applicaties of AI-toepassingen beter inzetten en gebruikers beter informeren over de waarheidsgetrouwheid van de bekomen resultaten, wat wordt gezien als een aanzienlijke (concurrentiële) meerwaarde bij beslissingsondersteuning.

Doelpubliek

Deze opleiding speelt in op de nieuwe trends in databeheer. Daardoor is de opleiding breed toegankelijk en volstaat enige basiskennis over databanken en AI als voorkennis. De opleiding is daarom onder andere geschikt voor:

  1. Datawetenschappers en data-analisten die hun kennis willen uitbreiden naar geavanceerde technieken en toepassingen op het gebied van databeheer, het beheren van tekstuele data en AI.
  2. Software-ontwikkelaars die databasefunctionaliteit willen integreren om hun applicaties en systemen klaar te maken voor AI-toepassingen.
  3. Bedrijfsanalisten en managers die inzicht willen krijgen in hoe geavanceerde databeheer-, tekstbeheer- en AI-technologieën kunnen worden toegepast om waarde te genereren voor hun organisaties.
  4. Studenten en academici die zich specialiseren in datagerelateerde disciplines zoals informatica, datawetenschap, artificiële intelligentie of bedrijfsinformatiesystemen.
  5. Professionals uit verschillende branches die hun kennis willen uitbreiden om geavanceerde analytische en voorspellende mogelijkheden te benutten in hun werk zoals bijvoorbeeld in de gezondheidszorg, financiën, marketing, enz.
  6. Professionals die hun kennis willen uitbreiden over het integreren, beheren, interpreteren en analyseren van tekstuele data voor informaticatoepassingen .

Er wordt gewerkt met eigen laptop. Deze moet krachtig genoeg zijn (minimum 8GB RAM) en deelnemers moeten administratierechten hebben voor het installeren van de nodige programma’s.

Programma

Waarom heb je NoSQL-systemen nodig?

In de introductie staan we stil bij de recente evolutie in datagebruik en datanoden. We leggen uit wat de karakteristieken zijn van ‘big’ data en welke uitdagingen dit meebrengt voor databeheer. Vervolgens staan we stil bij de tekortkomingen van conventionele databasesystemen en geven we de beschikbare oplossing voor elke uitdaging. Meer specifiek staan we stil bij technieken van horizontaal schalen, schemaloze databases, No-ACID systemen en technieken voor het omgaan met de waarheidsgetrouwheid van data. Deze oplossingen brengen ook nadelen met zich mee. Deze lichten we toe aan de hand van het CAP theorema en het principe van BASE systemen. Tot slot geven we een bondig overzicht van de bestaande NoSQL-oplossingen, die verderop in deze opleiding aan bod komen en gaan we dieper in op key-value stores, document stores en kolom stores die we vergelijken in functie van hun sterktes en zwaktes met het oog waarheidsgetrouwheid.

Data: 10 en 17 oktober 2024
Lesgever: Guy De Tré

Document stores in de praktijk

Binnen de NoSQL-databanken vormen de document stores een belangrijke categorie. Zoals de naam aangeeft, worden dit soort databanken gekenmerkt door het feit dat ze data opslaan in documenten (bv. JSON). Daardoor zijn ze zeer intuïtief en flexibel in gebruik, en schalen ze vrij goed. In deze lessen illustreren we het praktisch gebruik van document stores, hun voor- en nadelen met betrekking tot datakwaliteit en geven we aan in welke situaties ze best kunnen worden gebruikt. Daarbij worden er door middel van demo's een aantal fundamentele problemen aangegeven met betrekking tot het ontwerp van document stores, en het manipuleren en analyseren van data in document stores. We behandelen deze problemen voor verschillende document stores (MongoDB, CouchDB,...), en bespreken hoe een deze problemen worden aangepakt in een conventionele, relationele databank.

Datum: 24 oktober 2024
Lesgevers: Toon Boeckling en Maxime Deforche

Column stores in de praktijk

In deze les verkennen we column stores en hun toepassingen. We gaan dieper in op de verschillende noden bij Online Transaction Processing (OLTP) en Online Analytical Processing (OLAP) workloads. Ook het bijhouden van tijdsreeksen, een veel voorkomende toepassing van column stores, komt aan bod. We gaan dieper in op enkele concrete databanksystemen zoals DuckDB en Cassandra in een praktische demo.

Datum: 7 november 2024
Lesgever: Bart Mesuere

Datavisualisatie

In deze les gaan we dieper in op het belang van datavisualisatie en hoe we data op een effectieve manier kunnen voorstellen. We leren je de taal om te spreken over data en de componenten waaruit een visualisatie bestaat. Doorheen de les werken we met een voorbeeld waarbij we eerst de sterke en zwakke punten van een datavoorstelling identificeren en nadien zelf aan de slag gaan om betere alternatieven uit te werken. Bijzondere aandacht gaat naar aspecten van waarheidsgetrouwheid bij datavisualisatie.

Datum: 14 november 2024
Lesgever: Bart Mesuere

Graph databases in de praktijk

Met de behoefte aan nieuwe vormen om data te verwerken kwam ook de nood om data efficiënter te connecteren en via navigatie te kunnen doorzoeken en analyseren. Dit blies netwerkdatabanktechnologie niet leven in en resulteerde in graafdatabanken waarbij de "graaf-met-eigenschappen" (property graph) het dominant databankmodel is met GQL als nieuwe ISO standaard querytaal in wording. De lessen rond graafdatabanken zijn opgedeeld in twee delen. In het eerste deel wordt de kracht van connecties geïllustreerd, bekijken we het databankmodel achter een graafdatabank en hebben we ruim aandacht voor de toepassingsgebieden. Op dit moment is Neo4j wereldwijd het meest gebruikte graafdatabanksysteem. Hoe werkt dit systeem? Hoe integreer je een Neo4J graafdatabank met je bestaande databanken? Wat is Graph data science? Als afsluiter zetten we de stap naar de virtuele Neo4j omgeving waar je zelf kan kennismaken met de Cypher (een voorloper van de GQL standaard) querytaal. In het tweede deel graven we wat dieper in een graaf en geven we antwoorden op de volgende vragen: In welke opzichten verschilt graafmodellering van modellering in een relationele databank? Hoe modeleer je een graaf voor een specifieke toepassing? Hoe modeleer je een graaf voor Graph Data Science? Daarna gaan we terug aan de slag met de virtuele Neo4j omgeving. We laden (bulk) data, ontwikkelen de queries voor een "aanbevelings" applicatie, doen aan path finding en om af te sluiten doorlopen we de stappen om een data science pijplijn voor een graafdatabank op te zetten.

Data: 21 en 28 november 2024
Lesgever: Tom Geudens

Efficiënt omgaan met tekstuele data

In deze lesavond behandelen twee technologieën die een belangrijke rol spelen bij het omgaan met tekstuele data: NLP en AI-taalmodellen. NLP, of Natural Language Processing, is een gebied binnen de computerwetenschappen dat zich bezighoudt met de interactie tussen computers en menselijke taal. Het doel van NLP is om computers te helpen menselijke taal te begrijpen, analyseren en genereren op een manier die natuurlijk aanvoelt voor mensen. Dit omvat taken zoals automatisch vertalen, sentimentanalyse, spraakherkenning en chatbots. AI-taalmodellen zijn computerprogramma’s die ontworpen zijn om menselijke taal te begrijpen en te produceren. Ze maken gebruik van geavanceerde algoritmen en machine learning-technieken om patronen in tekstgegevens te herkennen en vervolgens natuurlijke taal te genereren die vergelijkbaar is met menselijke taal. Deze modellen kunnen worden ingezet voor taken zoals tekstgeneratie, vertaling, samenvatting en vraag-antwoordsystemen. Bij de bespreking van beide technologieën besteden we ruim aandacht voor de waarheidsgetrouwheid van resultaten, voor- en nadelen, praktisch gebruik en toekomstige verwachtingen.

Datum: 5 december 2024
Lesgever: Els Lefever

Vectordatabases en semantische indexen

Eén van de grootste uitdagingen op vlak van dataverwerking ligt in het op een betekenisvolle manier integreren en verbinden van data. Dit geldt temeer wanneer we ook rekening moeten houden met tekstuele documenten. Hoe kunnen de belangrijke elementen uit een document gehaald worden? Hoe kan de link gelegd worden tussen velden uit verschillende databanken en datamodellen? Kan de informatie uit documenten automatisch gelinkt worden aan de inhoud van databanken? Hoe kan ik mijn data bruikbaar maken voor AI? Het zijn allemaal vragen die terugkomen bij iedereen die ‘iets meer’ wil doen met data of die wil starten met AI in zijn organisatie. Tijdens de eerste lesavond bekijken we hoe Dynizer, een unieke semantisch intelligente dataoplossing van het Belgische bedrijf Consono.ai, semantische abstractie en AI gebruikt om data makkelijk te modelleren, integreren en op te vragen via DQL (een semantisch verrijkt SQL-dialect). We gaan ook dieper in de op de mogelijkheden die Dynizer biedt op vlak van documentanalyse, samenvatting en pseudonimisatie. Tijdens de tweede lesavond gaan we aan de slag met een aantal demo’s en voorbeelden. We zullen een paar datasets en documenten met Dynizer verwerken om dan via dashboards en DQL samen te ontdekken hoe het systeem automatisch de links tussen de inhoud van documenten en gestructureerde data blootlegt en je komt vertellen wat je nog niet wist over de data. De lesavond sluiten we af met een kritische noot en bespreking van waarheidsgetrouwheid van data in Dynizer.

Data: 12 en 19 december 2024
Lesgevers: Michael Brands en Guy De Tré

Lesdata

De lessen worden gegeven van 17u30 tot 21u, in 2 delen, gescheiden door een broodjesmaaltijd en vinden plaats aan de Universiteit Gent, UGent Academie voor Ingenieurs, Technologiepark 60, 9052 Zwijnaarde.

  • Er is geen les op 31 oktober 2024.
  • Data onder voorbehoud van wijzigingen om onvoorziene omstandigheden.
10 & 17 oktober 2024 - Waarom heb je NoSQL systemen nodig?

Guy De Tré

24 oktober 2024 - Document stores in the praktijk

Toon Boeckling & Maxime Deforche

7 november 2024 - Column stores in de praktijk

Bart Mesuere

14 november 2024 - Datavisualisatie

Bart Mesuere

21 & 28 november 2024 - Graph databases in de praktijk

Tom Geudens

5 december 2024 - Efficiënt omgaan met tekstuele data

Els Lefever

12 & 19 december 2024 - Vectordatabases en semantische indexen

Michael Brands & Guy De Tré

Lesgevers / sprekers

Guy De Tré

Praktijkervaring
Levenslang leren
Tips over hoe AI te gebruiken

Guy De Tré (°28/10/1970) is a full professor at the Department of Telecommunications and Information Processing of the Faculty of Engineering and Architecture at Ghent University, Ghent Belgium. He holds a Ph.D. in Applied Sciences from Ghent University and has served as a visiting researcher at the Université Paul Sabatier in Toulouse, France and at the Systems Research Institute of the Polish Academy of Sciences (SRI PAS) in Warsaw, Poland. He is the head of the Database, Document, and Content Management (DDCM) research group of Ghent University.

His research activities focus on computational intelligence in information management systems, encompassing fundamental research on uncertainty handling, multi-valued logics, and spatio-temporal modelling, as well as applied research in areas such as big data (NoSQL databases), information fusion, flexible querying, decision support, data veracity, and textual data management.

He is a principal investigator in the AI Flanders Research Program where he is responsible for research on data veracity and data quality.

He is (co)author of more than 300 scientific publications, of which 157 have been listed in the Web of Science. His publications include 18 books, 38 book chapters, and 102 journal papers.
 

He is a board member of the European Society for Fuzzy Logic and Technology (EUSFLAT) and a steering committee member of Flexible Querying Answering Systems (FQAS). He is area editor of the International Journal of Computational Intelligence Systems and member of the editorial board of the international journals Fuzzy Sets and Systems, Information Fusion and Mathematics.

Expertise: Data veracity, data management, computational intelligence, hybrid AI and explainable AI

Toon graduated cum laude from Ghent University in 2017, obtaining his degree as Master of Science in Computer Science Engineering.Since then, he has been employed at DDCM as a doctoral student for two years, followed by a four-year assistent track.

Interests: Databases, Data Quality, Big Data, Text Mining & NLP

Maxime graduated magna cum laude from Ghent University in 2022, obtaining his degree as Master of Science in Computer Science Engineering. Since then, he has been employed at DDCM as a doctoral student.

Interests: Databases, NoSQL, Graph Databases, Big Data, Graph Data Science

Bart Mesuere is een onderzoeker aan de Vakgroep Toegepaste Wiskunde, Informatica en Statistiek. Als datawetenschapper is hij betrokken bij verschillende uiteenlopende onderzoeksprojecten.

Binnen het Unipept-project (https://unipept.ugent.be) ontwikkelt hij analysetools die het voor wetenschappers uit de levenswetenschappen mogelijk maakt om hun -omics data op een gebruiksvriendelijke manier te analyseren. Als een van de trekkers van het Dodona-project (https://dodona.ugent.be) probeert hij de Vlaamse jeugd aan het programmeren te krijgen.

Bart is verantwoordelijke lesgever voor de vakken Software Engineering Lab 2, Datavisualisatie en Big Data Science binnen de opleiding Informatica.

Expertise: datavisualisatie, meta-omics, data-analyse

Graph Database Expert

Specialized in Linux System Administration, DevOps and Resource Oriented Computing. Author of the O'Reilly book "Resource-Oriented computing with NetKernel".

Els Lefever is hoofddocent bij de vakgroep Vertalen, Tolken en Communicatie, en is verbonden aan de onderzoeksgroep LT3 (Language and Translation Technology Team) en het Ghent Center for Digital Humanties. Els startte haar carrière als computationeel taalkundige in de R&D afdeling van Lernout & Hauspie Speech products, en behaalde haar doctoraat in de computerwetenschappen aan de UGent in 2012. Haar onderzoek richt zich op machine learning van natuurlijke talen en meertalige NLP, met een speciale focus op computationele semantiek, sentimentanalyse, automatische terminologie-extractie en digital humanities. Ze begeleidt doctoraatsonderzoek naar het modelleren van talen met weinig data, argumentatie in politieke social media berichten, NLP methodes voor Byzantijns Grieks en spijkerschrift, en het automatisch linken van lekentaal en professionele taal voor medische teksten. Ze doceert vakken over terminologie en vertaaltechnologie, digitale tekstanalyse, lokalisatie en digital humanities.

Expertise: Natural Language Processing, Machine Learning

Michael Brands is CEO and co-founder of Consono. He is the inventor of the patented data integration and management solution, the Dynizer.

Michael has helped redefine the way massive quantities of disparate data, created and stored in diverse formats and according to different models, can be used in harmony by focusing on the links within data, no matter what its source, or its destination. He explores the subject in his book: Data Harmonization in the Key of C (or How to Tune Your Data), which is available to download here…

A masters graduate in literature and linguistics from Belgium’s largest and highest-ranked university, the Katholieke Universiteit, Leuven, Michael first went into industry as a language specialist at Lernout and Hauspie, working on text-to-speech solutions. He earned a postgraduate degree in Computer Linguistics at the FLV Flanders Language Campus. For a while, he was a lecturer in applied linguistics at the Vlekho Business School in Brussels.

His first company, i.Know, focused on using Michael’s patented linguistic analytics to help alleviate the problem of information overload. That company was bought by American database management platform vendors, InterSystems, in 2010 and incorporated the technology into their own platform.

Having served for a while as senior product manager for i.Know within InterSystems, Michael set out in 2014 on his own data journey 2.0 to create Consono, initially as Dynactionize, bringing together trusted colleagues to help bring his Dynizer vision to fruition.