Fairness and Bias in Natural Language Processing
Hoe kan je Natural Language Processing inzetten en toch faire algoritmes opstellen, en dus vermijden dat de (historische) vooroordelen uit onze maatschappij worden meegenomen?
Praktische info:
Inschrijven?
- Inschrijvingen: tot 15 mrt. 2022
- Voorwaarden: goede kennis van machine learning
- Prijs: €140 voor professionals & €70 voor onderzoekers aan Vlaamse universiteiten of hogescholen
Natural Language Processing, of NLP, wint aan populariteit en duikt ook steeds meer op in het dagelijks leven, met als bekendste toepassing wel de vele chatbots op e-shops. Ondertussen blijven ontwikkelaars wel lop een uitdaging botsen: hoe maak je NLP eerlijk? De techniek waarbij de algoritmes leren uit bestaande, historische teksten en beslissingen, betekent immers dat het algoritme ook fouten uit het verleden meeneemt. Dus hoe kan je computers ‘eerlijker’ maken, als zij geen eerlijke input krijgen? Hoe kan je ervoor zorgen dat een systeem dat leert van bestaande teksten met historische vooroordelen tóch neutraal en onbevooroordeeld analyses maakt? Prof. Tim Van de Cruys (Dep. Taalkunde) en Pieter Delobelle (Dep. Computerswetenschappen) van KU Leuven leren je in twee halve dagen de belangrijkste technieken om vooroordelen in NLP te herkennen en vermijden.
Programma
Day 1: Introduction to NLP
Tim Van de Cruys, KU Leuven
Introduction to NLP (14h-16h)
- Different paradigms for NLP: symbolic, statistical, neural
- NLP applications
- Examples of bias in NLP applications
Neural architectures
- Word embeddings
- Continuous bag of words
- Convolutional neural networks
- Recurrent neural networks
- Transformer architectures
- Contextual representations and transfer learning
Practical session: word embeddings (16.30h-17.30h)
- Training word embeddings
- Analogy computations
- Gender bias in word embeddings
- Mitigating gender bias
Day 2: Fairness and Bias in NLP
Pieter Delobelle, KU Leuven
Introduction to bias (14h-16h)
- A classification of bias
- Model interpretability
- Measuring fairness
- Debiasing methods
- Transparent machine learning, model cards
Intrinsic and extrinsic measures of fairness
- History
- General fairness and definitions: stereotyping, protected groups, etc…
- Measuring fairness in NLP
- Evaluations in language models (focus because SOTA)
- Case study on evaluating fairness in RobBERT
- Differences with English
- WEAT/SEAT and PCA-based measures
- Issues with evaluations (“bad seeds”, “nordic salmon”, etc…)
Mitigating stereotypes in language models
- Overview of different methods
- Retraining, adapters, projections, …
- Limitations
Practical session: transformer models (16.30h-17.30h)
- Masked word prediction with BERT
- Biased prediction in BERT
- Finetuning a transformer model for classification
- Biased classification
Inschrijven
De inschrijving is pas definitief nadat de betaling werd ontvangen. We versturen de facturen zodra de inschrijving werd behandeld.
Annuleringsbeleid: Annulering is gratis (10% administratiekost tot 6 maart 2022. Daarna is een gratis annulering alleen nog mogelijk mits een geldige reden. Als er geen geldige reden gepresenteerd wordt, is er geen terugbetaling mogelijk.
Lesgevers / sprekers
Tim Van de Cruys is als hoofddocent verbonden aan de Onderzoekseenheid Taalkunde van de Faculteit Letteren (KU Leuven). Hij verricht onderzoek op het domein van de natuurlijketaalverwerking, met bijzondere aandacht voor het modelleren van betekenis en creatieve taalgeneratie.
Pieter Delobelle is momenteel AI-ingenieur bij Aleph Alpha, waar hij zich richt op inferentie, alignment en billijkheid van grote taalmodellen. Voorheen was hij postdoctoraal onderzoeker aan de KU Leuven met een specialisatie in bias en billijkheid in grote taalmodellen en ontwikkelde hij ook het state-of-the-art Nederlandse taalmodel RobBERT. Hij behaalde in 2018 een masterdiploma in de industriële wetenschappen aan de KU Leuven op de Technologiecampus Gent, België. Vervolgens behaalde hij een masterdiploma in kunstmatige intelligentie aan de KU Leuven en bleef hij daar voor een doctoraat in de computerwetenschappen onder professor Bettina Berendt en professor Luc De Raedt, dat hij in 2019 startte en in 2023 verdedigde, getiteld 'Towards fairer foundation models'. Zijn huidige onderzoek naar bias en billijkheid in grote taalmodellen leidde tot onderzoeksverblijven aan het Weizenbaum Instituut en de Bocconi Universiteit, evenals een stage bij Apple Inc.