Корпусна лінгвістика
КО́РПУСНА ЛІНГВІ́СТИКА — галузь мовознавства, предметом дослідження якої є принципи та методи формування корпусів текстів, а також розроблення компʼютерних систем для їхнього опрацювання. Корпус розглядають як модель мовної системи, реалізовану в текстах різних функціональних стилів, структури, тематики, призначення, території та часу їх створення. Залежно від призначення виділяють фундаментальні і пошукові (дослідницькі) корпуси, для роботи з якими створюють спеціальні текстові процесори — системи опрацювання інформації про мовні одиниці морфологічних, синтаксичних, логіко-семантичних структурних рівнів тексту. Такі системи зорієнтовані на анотацію (розмічення) тексту, яка передбачає формалізовані виділення у ньому мовних одиниць певних типів. Завдяки наявності автоматизованих засобів аналізу інформації корпуси придатні для виконання за допомогою компʼютера теоретичних і практичних завдань мовознавства. За повнотою подання текстів, їхнім структуруванням та наявністю засобів автоматизованого аналізу корпуси відрізняють від електронних бібліотек, картотек і баз цитат. Сучасні національні корпуси мають здебільшого фундаментальні характер, їхній обсяг сягає 200 і більше млн слововживань. Такими є, наприклад, Британський національний корпус (British National Corpus), Національний корпус русского языка, Narodowy Korpus Języka Polskiego або корпус текстів (Frantext) для укладення словника «Trésor de la langue française» («Скарбниця французької мови»). Корпуси текстів різних типів та призначення мають естонська, італійська, китайська, німецька, польська, російська, сербська, словенська, словацька, турецька, українська і чеська мови. В Україні перші корпуси україномовних текстів зʼявилися у 1990-х роках, зокрема корпус науково-реферативних та публіцистичних текстів, на базі якого співробітники відділу структурно-математичної лінгвістики (нині у складі Інституту української мови НАНУ, Київ) створили систему автоматичного орфографічного контролю тексту «Рута» та систему машинного російсько-українського і українсько-російського перекладу «Плай», а також корпус українських художніх, публіцистичних і наукових текстів, сформований у лабораторії компʼютерної лінгвістики Київського університету. Над укладанням фундаментальних національних корпусів україномовних текстів працюють науковці Українського мовно-інформаційного фонду НАНУ (Київ) та Інституту української мови НАНУ. Від 2009 при Міжнародному комітеті славістів працює Комісія з корпусної лінгвістики на чолі з М. Лазинським (Варшава), яка координує діяльність розробників корпусів словʼянських мов. Від 1996 виходить «International Journal of Corpus Linguistics».