Qu'est-ce qu'un texte, en fait ?
Le modèle OHCO (Ordered Hierarchy of Content Objects)
L’une de ces théories découle directement de la structure inhérente à un langage de balisage comme SGML (présenté dans la section Langages de balisage et modélisation du texte) et les langages qui en sont dérivés, dont HTML et XML. SGML structure les données de manière hiérarchique. En d’autres termes, les éléments doivent être imbriqués les uns dans les autres comme une série de poupées russes. De plus il existe des langages de règles (Schéma et les DTDs, présentés dans la section Modéliser avec XML ci-dessous) qui déterminent par exemple si des éléments peuvent être utilisés, à quel endroit et avec quelle fréquence, et si des éléments peuvent être utilisés une ou plusieurs fois au sein d’un autre élément.
En conséquence, un méta-langage comme XML ou SGML impose une façon particulière de penser les textes. A la fin des années 1980 et dans les années 1990 un groupe de chercheurs comprenant Allen Renear, Elli Mylonas, et David Durand a développé une théorie pour la pratique spécifique de l’encodage textuel et pour le texte en général, appelée ‘Ordered Hierarchy of Content Objects’ (OHCO). Ils firent la proposition que, même si différents types de textes peuvent être organisés différemment, ils ont tout de même une organisation hiérarchique. Dans leur première mouture du modèle OHCO, ils affirmaient :
Au sein des sous-sections de plus bas niveau se trouvent des objets tels que des paragraphes, des phrases, de la prose, des citations, des citations de vers, des équations, des démonstrations, des théorèmes, et ainsi de suite. Beaucoup de ces objets peuvent encore être décomposés. Cette structure est hiérarchique parce que ces objets sont imbriqués l’un dans l’autre comme des boîtes gigognes. Elle est ordonnée parce qu’il y a une relation linéaire aux objets : si l’on considère deux objets au sein d’un livre, l’un vient toujours avant l’autre. (Renear)
Ces objets imbriqués sont familiers dans les livres, par exemple : chapitres, sections, paragraphes, listes, etc. Comme avec l’exemple des poupées russes, ces objets s’insèrent parfaitement l’un dans l’autre, du plus petit (une lettre ou un mot) au plus grand (un livre ou une monographie), avec une myriade d’autres unités imbriquées en leur sein (phrases, paragraphes, chapitres, sections, etc.)
Si cette théorie a joué un rôle clé dans le développement de la TEI, elle n’a jamais complètement pris en compte le problème des chevauchements de hiérarchies. Le chevauchement des hiérarchies vient casser l’élégant modèle d’imbrication décrit plus haut. Par exemple, une métaphore dans un poème peut s’étendre sur deux lignes (marquées chacune pas la balise <l>). Le fait qu’un langage comme XML requière qu’un élément soit fermé avant qu’un autre ne soit ouvert peut sembler un problème purement technique. Cet exemple est donc correct :
- <l>texte texte texte</l>
- <l>texte texte <metaphor> texte texte</metaphor></l>
alors que celui-ci ne l’est pas :
- <l>texte texte <metaphor> texte texte</l>
- <l>texte texte </metaphor></l>.
Les créateurs de la théorie OHCO reconnaissent que cela peut être plus qu’un problème technique, et que cela peut révéler certains des problèmes les plus épineux qui marquent l’encodage textuel en tant qu’entreprise intellectuelle. Des éditeurs de textes tels que Jerome McGann, D.F. McKenzie et Peter Schillingsburg avaient developpé d’autres compréhensions du texte. Ils trouvaient le modèle OHCO trop simpliste pour représenter des œuvres complexes, littéraires en particulier. Essentiellement, ils arguèrent que les textes peuvent avoir de multiples structures et différents sens, dont certains en-dehors du texte lui-même. Le point d’orgue de ces approches rivales de l’édition de texte fut une pseudo-confrontation entre Renear et McGann à la conférence Digital Humanities tenue à l’université de Virginie en 1999. McGann a défendu l’idée de textes aux structures complexes et chevauchantes en utilisant l’exemple de la poésie :
la poésie n’est pas organisée selon une hiérarchie déterminée. Le balisage TEI et SGML donc, tout en étant raisonnablement adéquat pour les textes d’exposition ou informatifs, ne parvient pas à rendre les caractéristiques du texte poétique qui sont les plus saillantes pour ses producteurs et ses utilisateurs. Les textes poétiques sont des structures récursives construites à partir de réseaux complexes de répétitions et de variations. Aucun poème ne peut exister sans des systèmes de structures chevauchantes. (Hockney)
Par exemple, les métaphores peuvent courir sur plusieurs lignes ou strophes de vers. Les événements narratifs peuvent courir sur de nombreux paragraphes et peuvent en effet se chevaucher. Les textes dramatiques en vers contiennent des vers de dialogues (discours), des vers métriques, et des phrases. Mais ces phrases et ces vers métriques se chevauchent dans le cas des enjambements ou lorsqu’un personnage commence à parler et qu’un autre l’interrompt. (Renear). Toutes ces hiérarchies ont également vocation à être représentées.
C’est pourquoi la théorie du texte que SGML (et donc XML et TEI) exprime de manière la plus éloquente est celle que l’on pourrait qualifier d’éditoriale ou de bibliographique, c’est-à-dire celle qui représente le texte en termes de phrases, paragraphes, chapitres, texte préliminaire, annexes, et ainsi de suite. Ce n’est pas surprenant si l’on considère les racines du SGML, un langage écrit pour publier des textes documentaires sous forme électronique. De ce point de vue, on peut déduire que la vue documentaire du texte peut être lue comme son unique structure.
Bien que Renear et ses collègues aient défendu le modèle OHCO jusqu’au milieu des années 2000 dans une série d’articles qui ont raffiné et développé leur proposition initiale, au sein de la communauté TEI la plupart des chercheurs préfèrent la vision de McGann (tout en ayant par nécessité à se confirmer à un modèle OHCO, puisque c’est ce que le langage promeut naturellement) dans laquelle l’encodage textuel est approché dans une perspective de structures textuelles complexes, qui n’entrent pas toutes dans une hiérarchie rigide.
Lectures complémentaires
Hockey, Susan, Alan Renear, Jerome McGann. 'Panel: What is text? A Debate on the Philosophical and Epistemological Nature of Text in the Light of Humanities Computing Research. Web. 29 August 2016.McGann, Jerome. Radiant Textuality: Literature After the World Wide Web. London: Palgrave, 2001.
Renear, Allen, Elli Mylonas, and David Durand. “Refining Our Notion of What Text Really Is: The Problem of Overlapping Hierarchies.” N.p., 6 Jan. 1993. Web. 17 Sept. 2012.
Scholen, David and Sandra Scholen. 'Beyond Gutenberg: Transcending the Document Paradigm in Digital Humanities'. Digital Humanities Quarterly. Vol. 8 No. 4. 2014.
Shillingsburg, Peter L. Scholarly Editing in the Computer Age: Theory and Practice. Ann Arbor: University of Michigan Press, 1996.