Publication, langues et réutilisation du savoir
Un texte scientifique existe avec sa source, son édition, sa langue, sa terminologie, sa description bibliographique, sa structure, ses droits d’usage et son historique de modifications. Ces informations déterminent si l’on peut trouver le document, citer le fragment voulu, le comparer à une autre version, corriger une erreur, préparer une traduction ou l’intégrer dans un nouveau corpus.
Lorsque les décisions éditoriales ne subsistent que dans un PDF final, une partie du travail doit être reprise à chaque nouvel usage. L’infrastructure textuelle conserve ces décisions comme des ressources distinctes, décrites et versionnées.
Produire le savoir exige une infrastructure
Le système mondial de recherche dispose de ressources importantes, réparties de manière inégale entre pays et institutions. Selon le National Center for Science and Engineering Statistics des Etats-Unis, les dépenses mondiales de recherche et développement ont atteint environ 3,48 billions de dollars en parité de pouvoir d’achat en 2024. La Chine représentait 30 % de ces dépenses, les Etats-Unis 29 % et l’Union européenne 17,6 %.1 La même année, le périmètre observé comptait environ 3,5 millions d’articles scientifiques et techniques ; 31 % relevaient de la Chine, 12 % des Etats-Unis et 7 % de l’Inde.2
Ces indicateurs caractérisent la capacité de production des systèmes de recherche. Ils ne mesurent pas la qualité d’un article particulier et ne permettent pas de répartir la valeur intellectuelle par pays. Pour l’infrastructure textuelle, d’autres conséquences sont essentielles : les grands systèmes peuvent maintenir des éditeurs, des dépôts, des services bibliographiques, des bases terminologiques, des équipes de traduction, des plateformes logicielles et de longs cycles de correction.
Les données de l’Institut de statistique de l’UNESCO montrent un autre niveau d’écart. En 2023, l’Europe et l’Amérique du Nord comptaient en moyenne 4 358 chercheurs en équivalent temps plein par million d’habitants, contre 88 en Afrique subsaharienne. Soixante-treize pour cent des pays consacraient moins de 1 % de leur PIB à la recherche et développement.3 Ces grandeurs déterminent des capacités différentes d’accompagnement durable de la littérature spécialisée, même lorsque la publication initiale est ouverte.
| Indicateur | Dernières données disponibles | Signification pour l’infrastructure textuelle |
|---|---|---|
| Dépenses mondiales de R&D | 3,48 billions de dollars PPA, 2024 | Une communication scientifique complexe dépend de grands systèmes institutionnels |
| Part de la Chine et des Etats-Unis dans les dépenses mondiales | environ 59 %, 2024 | Une part importante de la capacité technique et éditoriale est concentrée dans quelques systèmes |
| Articles scientifiques et techniques | environ 3,5 millions, 2024 | Le volume exige des moyens durables de découverte, de description et de réutilisation |
| Chercheurs par million d’habitants | 4 358 en Europe et Amérique du Nord ; 88 en Afrique subsaharienne, 2023 | La capacité de créer et maintenir des ressources spécialisées varie fortement |
| Pays dont les dépenses de R&D sont inférieures à 1 % du PIB | 73 %, 2023 | De nombreux écosystèmes nationaux ne peuvent pas soutenir tous les domaines du savoir avec la même intensité |
La langue du travail scientifique
L’anglais sert de langue commune de travail à une part importante de la science internationale. Il réduit les coûts de coordination entre chercheurs, revues et conférences. En même temps, il déplace un travail supplémentaire vers les auteurs et lecteurs pour qui l’anglais n’est pas la première langue.
L’étude de Tatsuya Amano et de ses coauteurs a porté sur 908 chercheurs en écologie, biologie de l’évolution, conservation et disciplines voisines, dans huit pays.4 Parmi les participants ayant publié un article en anglais, les chercheurs de pays à niveau moyen d’anglais consacraient à la lecture d’un article un temps médian supérieur de 46,6 %, et ceux de pays à faible niveau un temps supérieur de 90,8 %, par rapport aux anglophones natifs. Pour la préparation du premier brouillon d’un article, les estimations correspondantes étaient de 50,6 % et 29,8 % de temps supplémentaire.5
Dans le même échantillon, 38,1 % des chercheurs de pays à niveau moyen et 35,9 % de ceux de pays à faible niveau indiquaient avoir connu un rejet d’article précisément en raison de la qualité de l’anglais écrit ; parmi les anglophones natifs, cette expérience était signalée par 14,4 %. Les demandes fréquentes d’amélioration de l’anglais pendant l’évaluation étaient mentionnées par 42,5 % et 42,6 % des non-natifs, contre 3,4 % des natifs.6
| Opération dans l’étude Amano et al. | Niveau moyen d’anglais | Faible niveau d’anglais | Groupe de contrôle |
|---|---|---|---|
| Temps supplémentaire de lecture | +46,6 % | +90,8 % | anglophones natifs |
| Temps supplémentaire pour rédiger le premier brouillon | +50,6 % | +29,8 % | anglophones natifs |
| Expérience d’un rejet lié à la qualité de l’anglais | 38,1 % | 35,9 % | 14,4 % |
| Demandes fréquentes d’amélioration de l’anglais en évaluation | 42,5 % | 42,6 % | 3,4 % |
L’étude concerne certaines disciplines, certains pays et des déclarations des participants. Ses résultats ne peuvent pas être transposés à tous les chercheurs ni à tous les domaines. Elle montre cependant de manière robuste le mécanisme : l’infrastructure linguistique internationale répartit de façon inégale le temps et les coûts éditoriaux.
Publication ouverte et réutilisation
L’accès ouvert règle la question de l’obtention légitime et gratuite d’une publication. Le travail ultérieur sur le matériau exige d’autres propriétés : adresse stable, métadonnées exploitables, licence claire, structure citable, indications de provenance et formats traitables hors de la plateforme initiale.
La Recommandation de l’UNESCO sur la science ouverte définit le savoir scientifique comme ouvertement accessible, utilisable et réutilisable. Les composantes nécessaires comprennent les dépôts, les plateformes ouvertes de publication, les identifiants, les services normalisés et les infrastructures interopérables.7 Les principes FAIR formulent la même exigence au niveau des données : l’objet doit être trouvable, accessible par un protocole standard, relié à des vocabulaires formels et accompagné d’une licence et d’une provenance.8
Pour un projet textuel, ces exigences se traduisent en objets éditoriaux concrets :
- notice bibliographique de la source ;
- identification stable de l’oeuvre et du fragment ;
- version du texte et journal des corrections ;
- indication distincte de l’auteur, du traducteur et de l’éditeur ;
- liens entre original, traductions et annotations ;
- règles de transmission des variantes ;
- export lisible par machine ;
- conditions de réutilisation.
Un fichier public devient une ressource durable lorsque ces informations peuvent être extraites et transférées avec le texte.
Travail éditorial multilingue
Chaque version linguistique crée un ensemble récurrent d’opérations. L’éditeur détermine la segmentation, choisit la terminologie, vérifie les noms et les citations, relie les fragments parallèles, consigne les divergences et met à jour le matériau après correction de la source. Lorsque les processus ne sont pas coordonnés, ces opérations sont répétées séparément pour chaque langue.
L’Union européenne compte 24 langues officielles. La mise en relation directe de chaque langue avec toutes les autres donne 552 directions de traduction ; le Parlement européen recourt également à des langues relais et à une infrastructure centralisée.9 Les mémoires de traduction, bases terminologiques et ensembles parallèles permettent de réutiliser des segments déjà vérifiés. Le service eTranslation de la Commission européenne a été entraîné sur des décennies de traductions institutionnelles et accepte des formats structurés, notamment TMX et XLIFF.10
| Opération récurrente | Ressource conservée | Usage ultérieur |
|---|---|---|
| Segmentation du texte | segments et identifiants stables | citation, alignement, extraction de fragments |
| Choix des termes | fiche terminologique | articles suivants, traductions, dictionnaires |
| Traduction | segments parallèles | contrôle de cohérence, mémoire de traduction, entraînement de modèles |
| Vérification des noms | forme d’autorité et variantes | recherche, catalogage, liens intersystèmes |
| Correction | journal des versions | reproductibilité et mise à jour des textes dérivés |
| Description de la source | métadonnées bibliographiques et provenance | évaluation de la fiabilité, réédition, export automatique |
L’échelle du Réseau-Observatoire est très inférieure à celle des institutions de l’Union européenne. Pour un petit projet, il est donc d’autant plus important de conserver le travail déjà accompli : le recréer coûte généralement plus cher que maintenir un registre correctement structuré.
Représentations textuelles réutilisables
Une version textuelle peut servir à la fois de matériau de lecture et de couche structurée de corpus. Pour cela, elle est reliée à la source, segmentée, dotée d’une terminologie stable et accompagnée d’informations sur la responsabilité éditoriale.
source et notice bibliographique
↓
segmentation stable et choix terminologiques
↓
traductions, annotations et représentations normalisées
↓
corpus parallèle · base terminologique · historique éditorial
↓
nouvelles éditions · dictionnaires · recherches · outils linguistiques
Cette architecture ne supprime pas le travail intellectuel du traducteur et de l’éditeur. Elle rend visibles et réutilisables les résultats de ce travail.
Branche romane du programme
Le Réseau-Observatoire accompagne une représentation lexico-syntaxique normalisée à base romane. Elle est appliquée dans certaines versions de lecture, fiches terminologiques et textes parallèles. Le profil fixe des contraintes sur les bases lexicales, la dérivation productive, l’ordre neutre des composants et l’expression de certaines relations grammaticales.
La réalisation textuelle complète de la rédaction active est utilisée dans des ressources linguistiques et éditoriales sous le nom romanova. La spécification du profil, la documentation linguistique générale et le corpus de ses applications sont publiés séparément. Un projet thématique peut ainsi citer une version normalisée précise sans transformer sa propre page en description de langue.
Le travail du Réseau-Observatoire consiste à accumuler des objets décrits : standards et profils, textes et fiches terminologiques, versions parallèles et provenance éditoriale. Leur valeur augmente lorsqu’une ressource préparée devient le matériau de départ de la suivante.
-
National Science Board. The State of U.S. Science and Engineering 2026. Alexandria, VA: National Science Foundation, 2026, section “R&D Activity and Research Publications,” https://ncses.nsf.gov/pubs/nsbsep20261/executive-summary. Les données sont recalculées en parité de pouvoir d’achat et peuvent être précisées. ↩
-
National Science Board. The State of U.S. Science and Engineering 2026, figure 29 and accompanying text, https://ncses.nsf.gov/pubs/nsbsep20261/figure/29. ↩
-
UNESCO Institute for Statistics. “2026 R&D Data Release: New Insights on Global Investment, Researchers and Gender Gaps.” March 18, 2026, updated June 22, 2026. https://www.uis.unesco.org/en/news/2026-rd-data-release. ↩
-
Tatsuya Amano, Valeria Ramírez-Castañeda, Violeta Berdejo-Espinola, et al. “The Manifold Costs of Being a Non-native English Speaker in Science.” PLOS Biology 21, no. 7 (2023): e3002184. https://doi.org/10.1371/journal.pbio.3002184. ↩
-
Amano et al., “Manifold Costs,” results, figure 1. Les pourcentages portent sur la comparaison modélisée des participants ayant publié un article en anglais. ↩
-
Amano et al., “Manifold Costs,” results, figure 2. Il s’agit de rejets que les répondants associaient à la qualité de l’anglais écrit, et non du taux général de rejet des articles. ↩
-
UNESCO. Recommendation on Open Science. Paris: UNESCO, 2021, paras. 7–9 and 17. https://www.unesco.org/en/legal-affairs/recommendation-open-science. ↩
-
Mark D. Wilkinson, Michel Dumontier, IJsbrand Jan Aalbersberg, et al. “The FAIR Guiding Principles for Scientific Data Management and Stewardship.” Scientific Data 3 (2016): 160018. https://doi.org/10.1038/sdata.2016.18. ↩
-
European Parliament. “Multilingualism in the European Parliament.” Accessed August 2026. https://www.europarl.europa.eu/about-parliament/en/organisation-and-rules/multilingualism. ↩
-
European Commission. “eTranslation.” Accessed August 2026. https://commission.europa.eu/resources-partners/etranslation_en. Voir aussi la documentation sur les formats et la réutilisation des traductions institutionnelles. ↩