Skip to main content
LibreTexts - Ukrayinska

6.4: Лексична перспектива

  • Page ID
    53843
  • \( \newcommand{\vecs}[1]{\overset { \scriptstyle \rightharpoonup} {\mathbf{#1}} } \) \( \newcommand{\vecd}[1]{\overset{-\!-\!\rightharpoonup}{\vphantom{a}\smash {#1}}} \)\(\newcommand{\id}{\mathrm{id}}\) \( \newcommand{\Span}{\mathrm{span}}\) \( \newcommand{\kernel}{\mathrm{null}\,}\) \( \newcommand{\range}{\mathrm{range}\,}\) \( \newcommand{\RealPart}{\mathrm{Re}}\) \( \newcommand{\ImaginaryPart}{\mathrm{Im}}\) \( \newcommand{\Argument}{\mathrm{Arg}}\) \( \newcommand{\norm}[1]{\| #1 \|}\) \( \newcommand{\inner}[2]{\langle #1, #2 \rangle}\) \( \newcommand{\Span}{\mathrm{span}}\) \(\newcommand{\id}{\mathrm{id}}\) \( \newcommand{\Span}{\mathrm{span}}\) \( \newcommand{\kernel}{\mathrm{null}\,}\) \( \newcommand{\range}{\mathrm{range}\,}\) \( \newcommand{\RealPart}{\mathrm{Re}}\) \( \newcommand{\ImaginaryPart}{\mathrm{Im}}\) \( \newcommand{\Argument}{\mathrm{Arg}}\) \( \newcommand{\norm}[1]{\| #1 \|}\) \( \newcommand{\inner}[2]{\langle #1, #2 \rangle}\) \( \newcommand{\Span}{\mathrm{span}}\)

    Смислова перспектива аналізу відносин є фундаментальною, але вона внутрішньо пов'язана з лексичною, оскільки зв'язок завжди виражається за допомогою слів у певній мові. Наприклад, ми розуміємо взаємозв'язок між поняттями або класами «їжа», «м'ясо» та «яловичина», використовуючи слова «їжа», «м'ясо» та «яловичина», щоб визначити поступово менші класи їстівних речей у класі ієрархія

    Зв'язок між поняттям і словами не така проста. У прикладі сім'ї Сімпсона, з якого ми розпочали цю главу, ми зазначили з «батько» та «падре», що мови відрізняються словами, які вони використовують для опису конкретних родинних стосунків. Крім того, ми зазначили, що культури відрізняються, в яких споріднені відносини концептуально відрізняються, так що такі мови, як китайська, роблять відмінності щодо відносного віку братів і сестер, які не зроблені англійською мовою. [1]

    Це не означає, що носій англійської мови не може помітити різницю між своїми старшими та молодшими сестрами, лише те, що ця відмінність не лексикалізована - захоплена одним словом - як це китайською мовою. Це «відсутнє слово» в англійській мові з точки зору китайської називається лексичним розривом. Саме тоді, коли існує лексичний розрив, іноді складно, тому що це залежить від того, як ми визначаємо «слово» - білий ведмідь і морський кінь не лексикалізовані, але вони є єдиною одиницею, що несе значення, оскільки ми не розкладаємо і не збираємо значення з двох окремих слів. Ці «лексичні прогалини» відрізняються від мови до мови, тоді як «концептуальні прогалини» - речі, про які ми не можемо думати або безпосередньо переживати, як тяга гравітації - можуть бути вродженими та універсальними. Ми переглядаємо це питання як «лінгвістична відносність» у розділі Категоризація: Опис класів та типів ресурсів. [2]

    Раніше в цій книзі ми обговорювали іменування ресурсів («Проблеми іменування») та оформлення словникового запасу для опису ресурсу («Обсяг, масштаб та опис ресурсу»), і пояснили, як збільшення обсягу та масштабу організаційної системи зробило важливим бути більш систематично і точно в присвоєнні імен і описів. Ми повинні бути впевнені, що терміни, які ми використовуємо для організації ресурсів, досить добре фіксують подібність та відмінності між ними, щоб підтримувати нашу взаємодію з ними. Після нашого обговорення семантичних відносин у цій главі ми тепер маємо більш чітке уявлення про те, що потрібно, щоб об'єднати подібні речі разом, тримати різні речі окремо та задовольнити будь-які інші цілі для організаційної системи.

    Наприклад, якщо ми організовуємо автомобілі, автобуси, велосипеди та санки, всі вони є транспортними засобами, існує важлива відмінність між транспортними засобами, які моторизовані, та тими, що працюють від людських зусиль. Також може бути корисно відрізнити транспортні засоби з колесами від тих, у яких їх немає. Не робити цих відмінностей залишає незбалансовану або нерівномірну організаційну систему для опису семантики домену транспортного засобу. Однак англійською мовою лексикалізується лише поняття «моторизований», саме тому нам потрібно було винайти термін «колісний транспортний засіб» у другому випадку. [3]

    Простіше кажучи, нам потрібно ефективно використовувати слова в організації систем. Для цього нам потрібно бути обережними щодо того, як ми говоримо про відносини між словами та як слова співвідносяться з поняттями. Існують два різних контексти для цих відносин.

    • По-перше, потрібно обговорити відносини між значеннями слів. («Відносини між значеннями слів») і найбільш часто використовуваний інструмент для їх опису («Тезаурі»).

    • По-друге, нам потрібно обговорити відносини між формою слів. («Відносини між словоформами»)

    Відносини між значеннями слів

    Існує кілька різних типів взаємозв'язків значень слів. Не дивно, що в більшості випадків вони паралельні типам відносин між поняттями, які ми описали в «Семантичній перспективі».

    Гіпонімія і гіперонімія

    Коли слова кодують семантичні відмінності, виражені класовим включенням, слово для більш конкретного класу в цьому відношенні називається гіпонімом, тоді як слово для більш загального класу, до якого воно належить, називається гіперним. Джордж Міллер запропонував зразкову формулу для визначення гіпоніма як його гіперніму, якому передують прикметники або слідують відносні речення, які відрізняють його від його співгіпонімів, взаємовиключних підтипів одного і того ж гіперніму.

    гіпонім = {прикметник+} гіпернім {відмінне речення+}

    Наприклад, Робін - гіпонім птаха, і його можна визначити як «перелітний птах», який має чітку мелодійну пісню і червонувату груди з сірим або чорним верхнім оперенням. Це визначення не описує кожну властивість розбін, але досить диференціювати робінів від синіх птахів або орлів. [4]

    Метонімія

    Частково цілі або меронімічні семантичні відносини мають лексичні аналоги в метономії, коли сутність описується чимось, що міститься в ній або іншим чином його частиною. Столиця країни або будівля, де проживають її топ-лідери, часто використовується як метонім для всього уряду: «Білий дім оголосив сьогодні...» Аналогічним чином, важливі концентрації ділової активності часто є метонімами для цілих галузей: «Уолл-стріт була звільнена під заставу знову вийшли...»

    Синонімія

    Синонімія - це зв'язок між словами, які виражають одне і те ж смислове поняття. Найсуворіше визначення полягає в тому, що синоніми «- це слова, які можуть замінити один одного в якомусь класі контекстів з незначними змінами змісту всього тексту. » [5] Це надзвичайно важкий тест для проходження, за винятком абревіатур або складних термінів, таких як «США», «Сполучені Штати» та «Сполучені Штати Америки», які є повністю замінними.

    Більшість синонімів не є абсолютними синонімами, а натомість вважаються пропозіційними синонімами. Пропозиційні синоніми не ідентичні за змістом, але вони досить рівнозначні, що заміна одного іншим не змінить істинного значення речення. Цей слабший тест дозволяє нам розглядати слово як синоніми, хоча їх значення тонко відрізняються. Наприклад, якщо Ліза Сімпсон вміє грати на скрипці, то оскільки «скрипка» і «скрипка» - це сузильні синоніми, ніхто не погодиться з твердженням, що Ліза Сімпсон може грати скрипку.

    Невпорядкований набір синонімів часто називають синсет, термін, який вперше використовується WordNet «семантичний словник» проект, розпочатий у 1985 році Джорджем Міллером у Прінстоні. [6] Замість того, щоб використовувати орфографію як основний принцип організації слів, WordNet використовує їх семантичні властивості та відносини для створення мережі, яка захоплює думку про те, що слова та поняття є нероздільною системою. Синсети взаємопов'язані як семантичними зв'язками, так і лексичними, що дозволяє здійснювати навігацію в будь-якому просторі. [7]

    Полісемія

    Ми ввели лексичний зв'язок багатозначності, коли слово має кілька різних значень або сенсів, в контексті проблем з іменами («Омонімія, багатозначність і помилкові споріднені»). Наприклад, слово «банк» може ставитися до: річковий берег, грошовий банк, банківські постріли в баскетбол і більярд, маневр літака та інші поняття. [8]

    Полісемія представлена в WordNet шляхом включення слова в кілька синтезаторів. Це дозволяє WordNet бути надзвичайно корисним ресурсом для глузду неоднозначності в дослідженнях та додатках обробки природної мови. Коли зустрічається багатозначне слово, воно і слова, які знаходяться поруч в тексті, шукаються в WordNet. Дотримуючись лексичних зв'язків у ієрархії синтезаторів, можна обчислити «синсетну відстань». Найменше смислове відстань між словами, яке ідентифікує їх найбільш семантично специфічний гіперним, може бути використано для виявлення правильного сенсу. Наприклад, в реченні:

    Покладіть гроші в банк

    Два з трьох почуттів WordNet для «грошей»:

    1) найпоширеніший носій обміну
    2) офіційна валюта, випущена державним або національним банком

    і перші два з десяти почуттів WordNet для «банку»:

    1) фінансова установа, яка приймає вклади
    2) похила земля, особливо схил біля водойми

    Синтетичні ієрархії для двох почуттів «гроші» перетинаються після дуже короткого шляху з ієрархією для першого сенсу «банк», але не перетинаються з другим значенням «банк», поки не досягнуть дуже абстрактних понять. [9]

    Антонімія

    Антонімія - це лексичний зв'язок між двома словами, які мають протилежні значення. Антонімія - це дуже виразний лексичний зв'язок, а для прикметників він навіть потужніший, ніж синонімія. У тестах на асоціацію слів, коли пробне слово є знайомим прикметником, найпоширенішою відповіддю є його антонім; зонд «хорошого» викликає «поганий», і навпаки. Як і синонімія, антонімія іноді точна, а іноді і більш градуйована. [10]

    Контрастні або двійкові антоніми використовуються у взаємовиключних контекстах, де можна використовувати те чи інше слово, але ніколи не обидва. Наприклад, «живий» і «мертвий» ніколи не можна використовувати одночасно для опису стану якоїсь сутності, оскільки значення одного виключає або суперечить значенню іншого.

    Інші антонімічні зв'язки між парами слів менш семантично гострі, оскільки іноді вони можуть з'являтися в одному контексті внаслідок більш широкої семантичної сфери одного зі слів. «Великий» і «маленький», або «старий» і «молодий», як правило, пропонують конкретні регіони за розміром або віком continua, але «наскільки він великий? » або «скільки років? » можна запитати про ресурси, які об'єктивно малі або молоді. [11]

    Тесаурі

    Слова, які люди природно використовують, описуючи ресурси, відображають їх унікальний досвід і перспективи, а це означає, що люди часто використовують різні слова для одного ресурсу і одні й ті ж слова для різних. Керування людьми, коли вони вибирають слова опису з контрольованого словника, є частковим рішенням цієї проблеми словникового запасу («Проблема словникового запасу»), яка стає все більш важливою з ростом обсягу та масштабу організаційної системи. Тезаурус - це довідкова робота, яка організовує слова відповідно до їх смисловими та лексичними зв'язками. Тезаури часто використовуються професіоналами, коли описують ресурси.

    Тезаурі були створені для багатьох доменів і предметних областей. Деякі тезаури дуже широкі і містять слова з багатьох дисциплін, таких як Бібліотека Конгресу предметних заголовків (LOC-SH), що використовується для класифікації будь-якого опублікованого вмісту. Інші часто використовувані тезаури є більш зосередженими, як Тезаурус мистецтва та архітектури (AAT), розроблений Getty Trust, та Законодавча індексаційна лексика, розроблена Бібліотекою Конгресу. [12]

    Ми можемо повернутися до нашої простої харчової таксономії, щоб проілюструвати, як тезаурус анотує словникові терміни лексичними та семантичними відносинами. Класові зв'язки включення гіперномії та гіпонімії зазвичай кодуються за допомогою BTширший термін») та NTбільш вузький термін»):

    Їжа БТ М'ясо
    Яловичина NT М'ясо

    Відносини BT і NT в тезаурусі створюють ієрархічну систему слів, але тезаурус - це більше, ніж лексична таксономія для деякої області, оскільки він також кодує додаткові лексичні зв'язки для найважливіших слів. Багато тезаури підкреслюють кластер відносин для цих ключових слів і де-підкреслюють загальну лексичну ієрархію.

    Оскільки метою тезаурусу є зменшення синонімії, він розрізняє синоніми або близькі синоніми, вказуючи один з них як бажаний термін, використовуючи UFвикористовується для»):

    Харчування UF Проживання, Харчування

    Тезаурус може використовувати USE як зворотне відношення UF, щоб посилатися з менш бажаного або варіантного терміна до бажаного:

    Корисні продукти харчування

    Тезаури також використовують RTпов'язаний термін» або «див. Також») для позначення термінів, які не є синонімами, але часто зустрічаються в подібних контекстах:

    Їжа RT Кулінарія, Їдальня, Кухня

    Відносини між формами слів

    Відносини між значеннями слів критично важливі. Щоразу, коли ми створюємо, комбінуємо або порівнюємо описи ресурсів, нам також потрібно звертати увагу на взаємозв'язки між формами слів. Ці відносини починаються з ідеї, що всі природні мови створюють слова і словоформи з менших одиниць. Основні будівельні блоки для слів називаються морфемами і можуть виражати смислові поняття (коли їх називають кореневими словами) або абстрактні поняття на кшталт «пасти» або «множини»). Аналіз способів, за допомогою яких мови поєднують морфеми, називається морфологією. [13]

    Прості приклади ілюструють це:

    «собаки» = «собака» (корінь) + «s» (множина)
    «невизначений» = «певний» (корінь) + «un» (заперечення)
    «denied» = «deny» (корінь) + «ed» (минулий час)

    Морфологічний аналіз мови широко використовується в обробці тексту для створення індексів для пошуку інформації. Наприклад, stemming (більш детально розглянуто у Взаємодії з ресурсами) - це морфологічна обробка, яка видаляє префікси та суфікси, щоб залишити кореневу форму слів. Аналогічно, прості програми для обробки тексту, такі як переноси та корекція орфографії, вирішують проблеми у формі слів, використовуючи коріння та правила, оскільки це більш масштабоване та надійне, ніж їх вирішення за допомогою списків слів. Багато помилок написання поширених слів (наприклад, «біль») є словами меншої частоти (наприклад, «панель»), тому додавання «панелі» до списку слів з помилками іноді може визначити їх неправильно. Крім того, оскільки природні мови генеративні і постійно створюють нові слова, список слів ніколи не може бути повним; наприклад, коли «flickr» зустрічається в тексті, це неправильне написання «мерехтіння» або правильне написання популярного сайту для обміну фотографіями?

    Морфологія деривації

    Похідна морфологія стосується того, як слова створюються шляхом об'єднання морфем. Складання, складання двох «вільних морфем» разом, як у «Бетмена» або «жінка-кішка», є надзвичайно потужним механізмом. Значення деяких сполук легко зрозуміти, коли перша морфема кваліфікує або обмежує значення другої, як в «пташиній клітці» і «платній будці». » [14] Однак багато сполук набувають нових значень, які не так буквально походять від значення їх складових, як «морський коник» та «бетмен. »

    Інші види похідних з використанням «зв'язаних» морфемів дотримуються більш точних правил поєднання їх з «базовими» морфемами. Найбільш поширеними типами пов'язаних морфем є префікси і суфікси, які зазвичай створюють слово іншої категорії частини мови при їх додаванні. Знайомі англійські префікси включають «а-», «ab-», «анти-», «co-», «де-», «pre-» і «un-. » Серед найпоширеніших англійських суфіксів є «-able», «-ation», «-ify», «ing», «-ity», «-ize», «-ment» та «-ness. » Складання та додавання префіксів або суфіксів - прості механізми, але дуже складні слова на кшталт «немислимість» можуть бути сформовані, використовуючи їх у поєднанні.

    Інфлекційна морфологія

    Інфлекційні механізми змінюють форму слова, щоб представляти час, аспект, згоду або іншу граматичну інформацію. На відміну від деривації, перегин ніколи не змінює частину мови базової морфеми. Інфлекційна морфологія англійської мови відносно проста в порівнянні з іншими мовами. [15]


    1. Мови та культури відрізняються тим, як вони розрізняють і описують спорідненість, тому Барт може знайти систему організації сім'ї легше освоїти в одних країнах і культурах і складніше в інших.


    2. (Бентівоглі і П'яанта 2000).


    3. Цей приклад походить від (Fellbaum 2010, сторінки 236-237). Німецька має слово Kufenfahrzeug для транспортного засобу на бігунів.


    4. (Міллер 1998).


    5. (Большаков і Гельбух 2004), с. 314. Цитата продовжується: «Посилання на «якийсь клас» та «незначні зміни» роблять це визначення досить розпливчастим, але ми не знаємо жодного значно суворого визначення. Звідси створення словників синонімів, які, як відомо, досить великі, є скоріше справою мистецтва та проникливості. »


    6. Джордж Міллер зробив багато важливих внесків у вивчення розуму та мови протягом своєї довгої наукової кар'єри. Його найвідоміша стаття «Магічне число сім, плюс або мінус два» (Міллер 1956) була насіннєвою у своїх пропозиціях про організацію інформації в людській пам'яті, хоча це одна з найбільш помилкових наукових праць усіх часів. Порівняно пізно в кар'єрі Міллер почав проект WordNet зі створення семантичного словника, який зараз є необхідним ресурсом в додатках обробки природної мови. Див. http://wordnet.princeton.edu/.


    7. Цю навігацію найпростіше здійснити за допомогою комерційного продукту під назвою «Візуальний тезаурус» за адресою http://www.visualthesaurus.com/.


    8. Ці контрастні значення для «банк» є чіткими випадками багатозначності, але часто існують набагато тонші відмінності в значенні, які виникають з контексту. Дієслово «зберегти», здається, означає щось інше в «Покупця врятував... » проти «Рятувальник врятував... » хоча вони певним чином перекриваються. (Філлмор і Аткінс 2000) та інші запропонували визначення багатозначності, але не існує суворого тесту для визначення того, коли значення слів досить розходяться, щоб називатися різними сенсами.


    9. Запропоновано багато методик використання WordNet для обчислення мір семантичної подібності. Див. (Буданицький і Хьорст 2006).


    10. Див. (Гросс і Міллер, 1990).


    11. Цей тип «лексичної асиметрії» називається «помітністю». » Більш широкий або домінантний термін - це немаркований, а вужчий - позначений. Див. (Баттістелла 1996).


    12. http://www.loc.gov/library/libarch-thesauri.html, http://www.getty.edu/research/tools/vocabularies/aat/index.html.


    13. Мови сильно відрізняються морфологічною складністю і характером їх морфологічних механізмів. Мандарин китайський має відносно мало морфем і мало граматичних перегинів, що призводить до величезної кількості омофонів. Англійська мова досить середня за цією шкалою. Популярним підручником з морфології є (Haspelmath and Sims 2010).


    14. Ці так звані ендоцентричні сполуки по суті означають, що морфеми означали б окремо. Але якщо «пташина клітка» - це саме «клітка для птахів», що здобувається створенням нового слова? Це питання вже давно обговорюється в предметній класифікації, де він оформляється як контраст між «докоординацією» і «посткоординацією». Наприклад, чи краще попередньо класифікувати деякі ресурси як про «Спортивні азартні ігри», чи слід знайти такі ресурси, перетинаючи ті, що класифікуються як про «Спорт» та про «Азартні ігри». » Див. (Свеноній 2000, стор. 187-192).


    15. Англійські іменники мають множину (книга/книги) та присвійні форми (книга професора), прикметники мають порівняльні та суперлативи (великий/більший/найбільший), а правильні дієслова мають лише чотири перегнуті форми (див. cla.calpoly.edu/~jrubba/morph/morph.over.html). Навпаки, у класичній грецькій мові кожен іменник може мати 11 словоформ, кожен прикметник 30, а кожне регулярне дієслово понад 300 (Андерсон 2001).