Ce cours propose d'introduire les étudiant·e·s à une discipline nouvelle en sciences humaines: la science des données appliquée aux textes. Il ne s’agit pas ici de programmer, mais de réfléchir à comment transformer un texte en données utilisables pour la recherche en sciences humaines, mais aussi à ce qu’implique cette transformation.

Les nouvelles approches computationnelles du texte ont toutes pour point commun d'avoir besoin de données, qui prennent la forme de textes encodés. Ces textes sont des éditions critiques (pour les philologues) ou des corpus (pour les historien·ne·s, les littéraires ou les linguistes), dont la constitution obéit désormais à des standards et des bonnes pratiques qu'il est nécessaire de connaître.

Au cours du semestre, nous découvrirons le langage XML, et notamment le XML-TEI, devenu le principal standard mondial pour l'encodage de texte. Aucune connaissance préalable de l'informatique n'est attendue.

Ce cours est ouvert à tous les niveaux (BA, MA). Il est accessible aux grand·e·s débutant·e·s et ne nécessite aucun prérequis en informatique (au contraire). Les étudiant·e·s sont libres de travailler sur les sources et le sujet de leur choix.

Un ordinateur portable est nécessaire (pas de tablette), avec accès internet et droits d’administration sur la machine.