Комп’ютерна лінгвістика
КОМПʼЮ́ТЕРНА ЛІНГВІ́СТИКА — галузь мовознавства, що вивчає мову за допомогою компʼютера, а також створює лінгвістичне забезпечення для компʼютерних систем опрацювання інформації. Як самостійний науковий напрям сформувалася в 1960-і роки на базі досягнень структурної, математичної та прикладної лінгвістики, лінгвосеміотики, а також обчислювальної техніки, кібернетики й інформатики. Появу К. л. спричинила потреба суспільства в нових оперативних способах опрацювання мовної інформації, зокрема необхідність створення систем машинного перекладу, в основу яких покладено формальні аналоги мови. У світовій науці сформувалося широке розуміння обʼєкта й предмета вивчення К. л., що розвʼязує як фундаментальні теоретичні, так і прикладні завдання сучасного мовознавства. До фундаментальних завдань належить створення моделей мовних явищ і процесів, придатних для опрацювання компʼютером, що передбачає виявлення таких закономірностей будови та функціонування мови, які можна описати з використанням формально-логічних і математичних методів.
Різнотипні моделі мови — статичні й динамічні, дедуктивні й індуктивні, аналітичні (інтерпретаційні) й синтетичні (генеративні, породжувальні) — закладають основу для розвʼязання практичних завдань компʼютерного опрацювання мовної інформації: автоматичного укладання словників, створення систем машинного перекладу, інформаційно-пошукових, навчальних та експертних систем, корпусів мови, аналізаторів і синтезаторів усного мовлення. Провідними напрямами сучасного К. л. є компʼютерна лексикографія, корпусна лінгвістика, автоматичний аналіз тексту. З появою Інтернету формується новий напрям — мережна лінгвістика, або інтернет-лінгвістика.
В українському мовознавстві перші праці в цій галузі зʼявилися в середині 1960-х років і були повʼязані з моделюванням штучного інтелекту, вивченням статистичних закономірностей письмового й усного мовлення, створенням формальних граматик мови. Основи К. л. в Україні заклали відділи документальних інформаційних систем на чолі з Е. Скороходьком та розпізнавання й синтезу звукових образів під керівництвом Т. Вінцюка Інституту кібернетики АН УРСР, відділ структурно-математичної лінгвістики Інституту мовознавства АН УРСР (обидва — нині НАНУ) на чолі з В. Перебийніс, 1986–2004 його очолювала Н. Клименко (від 2011 — у складі Інституту української мови НАНУ, завідувач — Є. Карпіловська; усі — Київ), кафедра математичної лінгвістики Київського університету під керівництвом Ф. Нікітіної (1985 реорганізована у кафедру математичної інформатики, яку очолив А. Анисимов), кафедра загальної та прикладної мовознавства Харківського університету на чолі з В. Акуленком (нині завідувач — І. Кравчук). Сьогодні в Україні над проблемами К. л. працюють також Український мовно-інформаційний фонд НАНУ (Київ; директор — В. Широков), лабораторія компʼютерної лінгвістики Київського університету (завідувач — Н. Дарчук), Київського лінгвістичного університету (завідувач — Т. Бобкова).
У розвиток теоретичної бази українського К. л. вагомий внесок зробили А. Білецький, В. Перебийніс, Е. Скороходько, Ф. Нікітіна, Н. Клименко, І. Севбо, М. Пещак, В. Войнов, І. Штерн, Л. Пшенична, М. Муравицька, Л. Орлова, Т. Грязнухіна. Українські науковці розвивають також ідеї світового К. л., втілені в працях С. Шаумяна, М. Андреєва, Ю. Апресяна, І. Ревзіна, І. Мельчука, Р. Піотровського, Г. Бєлоногова, Ю. Тулдави, А. Шайкевича, О. Падучевої, В. Плунгяна, К. Рахіліної, Н. Хомського, З. Харриса, Ч. Хокета, Ю. Найди, У. Френсіса.
Проблеми К. л. висвітлюють журнал «Українська мова», «Мовознавство», збірник «Українське мовознавство», «Лінгвістичні студії» та «Лінгвокомпʼютерні дослідження». Українська компʼютерна лексикографія представлена значною кількістю електронних версій традиційних (укладених вручну) словників. Для вільного доступу в Інтернеті викладено близько 300 українських словників різних типів. На базі компʼютерних версій традиційних словників створені інтегровані словникові бази, що дають змогу користувачам одержувати різні відомості про слово, зокрема інтегрована лексикографічна система «Словники України», яку розробив і виклав в Інтернеті Український мовно-інформаційний фонд НАНУ, містить електронні версії орфографічних, орфоепічних, граматичних та фразеологічних словників, а також словників синонімів та антонімів.
Крім версій традиційних словників, є й автоматичні словники, або словники, укладені компʼютером. Саме такі праці в К. л. називають словниками нового покоління. Вони можуть становити самостійне джерело інформації про мову, як, наприклад, частотно-валентний «Словник афіксальних морфем української мови», який уклали Н. Клименко, Є. Карпіловська, В. Карпіловський, Т. Недозим (електронну версію створено 1991, опубліковано 1998). Автоматичні словники можуть входити також до складу лінгвістичного забезпечення різних компʼютерних систем опрацювання інформації.
Такими є словники (орфографічний, тезаурус, конкорданс, або словник сполучуваності слів) у складі системи орфографічного контролю українських текстів «Рута» та системи українсько-російських й російсько-українських машинних перекладу «Плай», що становлять український офіс операційної системи Windows фірми «Microsoft» (розробники — Т. Грязнухіна, Л. Орлова, В. Критська, Т. Пуздирева, Т. Недозим, Н. Дарчук, Л. Алексієнко, Г. Колєнов і В. Сорокін), або перекладні компʼютерні словники в складі навчального комплексу «Глоса», який створив колектив лабораторії компʼютерної лінгвістики Київського лінгвістичного університету під керівництвом В. Перебийніс.
В основу українського офісу системи Windows покладено системи морфологічного, синтаксичного та логіко-семантичного аналізу українських і російських текстів, які впродовж 1980–90-х років створені у відділі структурно-математичної лінгвістики Інституту мовознавства НАНУ. Національний корпус мови як показове за обсягом зібрання текстів різних стилів і жанрів, придатне для опрацювання компʼютерними технологіями, вже став поруч зі словником і граматикою надійним інструментом наукового дослідження мови та розвʼязання практичних завдань суспільства.
На сьогодні корпуси показового обсягу (від 200 млн до понад 1 млрд слововживань) мають не лише такі провідні західноєвропейські мови, як англійська, французька, німецька, а й словʼянські мови: російська, польська, словацька, чеська. В Україні над створенням Українського національного лінгвістичного корпусу від кінця 1990-х років працює Український мовно-інформаційний фонд, проте відкритого доступу до цього корпусу користувачі поки що не мають. В Інтернеті розміщено лише Корпус української мови (обсягом 13 млн слововживань), створений у лабораторії компʼютерної лінгвістики Київського університету під керівництвом Н. Дарчук. Він охоплює тексти художніх, наукових та публіцистичних стилів. У цьому корпусі здійснено спеціальну лінгвістичну анотацію текстів (морфологічну, синтаксичну й семантичну) для виконання теоретичних і практичних досліджень із К. л. та для потреб лінгводидактики.