Scénario de recherche : exploiter les sources sérielles, l'exemple des annuaires professionnels du cinéma
Objectif et contexte du projet
Comment réaliser le recensement des femmes dans les métiers du cinéma ? Quelles sources sont disponibles ? Comment les exploiter ? Avec quels outils ?
Lauréat du dispositif ArTeC, le programme de recherche « Les femmes dans les métiers du cinéma français 1920-1960 » porté par la Bibliothèque nationale de France (BnF) se penche sur les carrières et les trajectoires des femmes dans cette industrie relativement bien connue.
Pour cela, le projet se base sur les riches collections numériques de la BnF et des outils de traitement automatique innovants développé par le laboratoire de recherche EPITA, impliqué dans le projet Mezanno, et le laboratoire d’Intelligence Artificielle et Sémantique des Données (LIASD).
Le présent scénario de recherche a pour objectif d’exposer une partie des méthodes et outils utilisés pour en faciliter le réemploi sur d'autres problématiques.
Comment construire un corpus centré sur les métiers du cinéma ?
Les équipes ont dans un premier temps travaillé les annuaires professionnels, une source particulièrement compliquée à dépouiller car très codifiée, difficile à lire sur la longue durée et dont la structure est aussi importante que le contenu. Trois publications ont retenu l'attention des équipes : l’annuaire dit « Bellefaye », Le Tout Cinéma et l’Annuaire général de la cinématographie des industries qui s’y rattachent.
L’Annuaire Bellefaye
Fondé en 1949 par Pierre Bellefaye, l’Annuaire du Cinéma, communément appelé Le Bellefaye, initialement publié sous format papier, offre un panorama exhaustif de l’écosystème professionnel : films, comédiens, réalisateurs, techniciens, sociétés de production, circuits de distribution, salles de cinéma, ainsi que les réglementations et normes techniques en vigueur. Il recense les coordonnées des entreprises (maisons de production, distributeurs, agences de casting, laboratoires, etc.), des professionnels (acteurs, réalisateurs, techniciens) et des médias spécialisés. Il inclut également des informations détaillées sur les équipements des salles, le statut juridique des sociétés, ainsi que des rubriques d’actualité, des agendas et des offres d’emploi. Chaque édition recense également les lois, décrets et données statistiques (nombre de films produits, dates de sortie, etc.), constituant une source précieuse pour les historiens, les étudiants et les professionnels.
Après 67 éditions annuelles en version papier, la société Éditions Bellefaye est radiée en 2000, mais la collection historique est préservée grâce à une donation à la Cinémathèque de Paris en 2016. Dès 2017, l’annuaire renaît sous une forme d'une base de données en ligne, mise à jour quotidiennement, qui référence plus de 88 000 profils couvrant 553 métiers et activités dans les domaines du cinéma, de l’audiovisuel et du numérique. Elle est disponible dans les ressources électroniques de la BnF.
Le Tout Cinéma
Le Tout-Cinéma parait pour la première fois en 1921 et recense méthodiquement les adresses et coordonnées des artistes, auteurs et scénaristes, metteurs en scène, opérateurs de prise de vue, producteurs, salles de projection (à Paris, en province et dans les colonies), studios, sociétés de production, éditeurs, loueurs de films, ainsi que les journaux et revues spécialisés. Il inclut également des portraits photographiques des personnalités du milieu, des bilans financiers, des statistiques, des informations sur la législation cinématographique, et des publicités d’époque. Les éditions ultérieures, comme celle de 1929 ou de 1936-1937, intègrent des plans dépliants des cinémas parisiens et des galeries de portraits impressionnantes, parfois accompagnées de fiches détaillant les films dans lesquels les acteurs ont joué.
L’annuaire se présente sous un format imposant, souvent relié en percaline éditeur, et se caractérise par une abondance d’illustrations et de photographies. Il reflète ainsi l’effervescence et la structuration progressive d’une industrie en pleine expansion, tout en constituant un témoignage précieux sur l’évolution des métiers, des technologies et des réseaux du cinéma.
L’Annuaire général de la cinématographie et des industries qui s’y rattachent
L’Annuaire général de la cinématographie et des industries qui s’y rattachent est une publication périodique française, dirigée notamment par Jean Pascal, qui voit le jour dans l’entre-deux-guerres. Comme le Tout Cinéma et Le Bellefaye, il s’inscrit dans un contexte de structuration et de professionnalisation croissante de l’industrie cinématographique, alors en pleine expansion.
L’annuaire se présente sous la forme d’un volume imposant, souvent richement illustré et organisé en rubriques thématiques. Par exemple, l’édition de 1932-1933 compte 1 244 pages, tandis que celle de 1937, plus concise, en compte 433.
Comme pour les deux séries précédentes, on trouve dans ses pages des listes détaillées des sociétés, notamment de production ou de distribution, des annuaires professionnels recensant les noms et adresses des acteurs, réalisateurs, techniciens, et autres métiers du cinéma, mais également de nombreuses publicités et des portraits d’artistes.
Quel état des collections pour ces publications à la BnF?
Le Catalogue général de la BnF permet de localiser les exemplaires présents dans les collections de la BnF. Par exemple :
- Annuaire général de la cinématographie et des industries qui s'y rattachent
- Annuaire du cinéma (Editions Bellefaye),
- Le Tout cinéma (1921-1953/54), Le Tout cinéma (1942, 1946)
Toutes les collections physiques n’ont pas fait l’objet d’une numérisation dans Gallica, la bibliothèque numérique de la BnF :
- 2 années seulement sont disponibles pour l'Annuaire général
- Il n'existe pas d'exemplaire en ligne du Bellefraye
- 15 numéros allant de 1923 à 1953 sont disponibles pour le Tout-Cinéma
Ces sources, par leur caractère sériel et la qualité des informations présentes, sont incontournables pour l'étude prosopographique ou démographique. Elles présentent toutefois la difficulté d'être peu maniables : fragilité des matériaux, typographie serrée, très codifiée, et surtout impossibilité de traiter humainement toutes ces données. Il faut, pour une analyse en masse de ces documents sur plusieurs années, outiller le corpus pour permettre une forme d'automatisation pour extraire non seulement l'information (les noms, prénoms, adresses, métiers...), mais aussi leur structure pour en constituer une base de données exploitable.
Corpusense, un outil dédié au traitement de documents sériels
Pour le traitement de ces documents au format dit sériel, il faut un outil qui permette à lafois d'extraire le contenu et la forme. C'est ce que propose l'outil en ligne CorpuSense, qui a été développé dans le cadre du projet Mezanno, projet de recherche du plan quadriennal de la recherche 2024-2027 en partenariat avec le Laboratoire de recherche de l’EPITA, le Centre de Recherches Historiques de l’EHESS et le Laboratoire en Sciences et Technologies de l’Information Géographique (LASTIG) de l’IGN.
Quel est le fonctionnement de CorpuSense et comment a-t-il été appliqué au projet consacré aux femmes dans les métiers du cinéma français ?
CorpuSense permet de :
- Importer des documents et sélectionner les pages qui vous intéressent pour créer vos corpus personnalisés.
- Traiter vos corpus grâce à des fonctionnalités telles que la reconnaissance de texte (OCR) et l’extraction de données structurées.
- Analyser et exploiter vos documents sans avoir besoin de compétences techniques particulières.
La documentation disponible en ligne ainsi que les ateliers de présentation facilitent sa découverte.
Importer des documents
Plusieurs étapes s’enchaînent pour importer un annuaire depuis Gallica.
Etape 1. Ouvrir un manifest. Il s’agit d’un fichier au format json qui va décrire la ressource ou document quelle que soit sa nature (livre, carte, etc.). Construit selon le standard IIIF, ce fichier contient des liens vers les images et les métadonnées correspondantes à ces images.
- Dans la barre de recherche de Gallica, on recherche l’annuaire à traiter, puis on sélectionne la notice du document. Un fois sur la page web du document, on récupère l’identifiant ark du document.
- De retour dans l’application CorpuSense, on clique sur le bouton « ouvrir un manifest » pour coller l’identifiant ark. Le manifeste s’affiche sur l’écran de l’application qui est alors divisé en trois parties : à gauche les informations et métadonnées du document, au centre une grille avec toutes les pages, à droite l’espace de visualisation pour chaque page (ou canvas).
Etape 2. Sélectionner les pages. Afin de traiter uniquement les contenus pertinents, on crée une collection à partir de pages sélectionnées qui feront ensuite l’objet d’un même traitement.
- Dans la partie centrale de l’écran, on choisit des pages en définissant le début et la fin de la sélection.
- Avec un clic droit, on créer ensuite une collection à partir de la sélection. Cette collection apparaît dans la liste « Gestionnaire de collection ».
Etape 3. Modifier la collection. La première version de la collection peut faire l’objet de modifications qui permettent de modifier les informations, ajouter des éléments ou supprimer des éléments.
- Dans le gestionnaire de collections, on sélectionne la collection à modifier.
- Elle s’affiche dans un nouvel écran divisé en 3 parties : les informations en haut à gauche, la grille de pages/miniatures en bas à gauche, et à droite l’écran de modification.
- Il est possible de modifier les informations de la collection (titre, description, étiquette), d’ajouter des pages manquantes depuis le manifest ou en retirer (par exemple des pages de pub dans l’annuaire).
Vérifier la qualité d’OCRisation des pages
L’application CorpuSense comporte un traitement pour réaliser des extractions de texte (OCR). Que l’on dispose déjà d’une version texte du document ou pas, cette étape reste intéressante. Elle peut notamment permettre d’obtenir un texte brut plus proche du document.
Le traitement OCR est possible sur toute la collection, grâce à l’outil couteau-suisse au-dessus de la grille, ou uniquement sur une page avec le même outil disponible dans l’écran de droite, ou encore sur une zone de la page.
Les traitements effectués se retrouvent dans la rubrique « Mes traitements ». L’export des résultats pour chaque traitement se fait depuis cette rubrique.
Extraire des données structurées grâce à l’IA
Pour extraire les données à partir du texte et de manière structurée, l’application a recours à l’API de Mistral. Il est donc nécessaire de se créer un compte pour obtenir une clé API.
Etape 1. Créer un modèle de données.
- Dans la rubrique « Gestionnaire de modèles », on clique sur créer un modèle. Pour chaque modèle, le prompt est modifié pour s’adapter au plus près de chaque annuaire.
- Pour chaque ligne de l’annuaire, on réfléchit à la manière d’identifier ou de nommer chaque type de données et on définit les champs : le nom de famille, le prénom, l’adresse, etc.