PlayPendium
WordChess · Food for Thought

Навчання машини 149 000 слів у 22 мовах

Словній грі потрібно більше, ніж список допустимих рядків. Вона має пояснювати, що означає кожен з них means, а значення — найскладніше, що можна зберегти.

01 · The lemma and its shadows

One word, and all the shapes it takes

WordChess plays on a 25×25 board with a 148,941-word English dictionary6, записи середньою довжиною 8,6 літер, деякі сягають 25. Це легка частина. Список допустимих слів — це просто набір рядків, які гра прийме. Цікава частина — це пояснення гравцю, що означає рядок на дошці means, і робити це одночасно для двадцяти двох мов.

Лексикографи чітко розмежовують лемма і її відмінювані форми. Лемма — це головне слово, яке ви шукаєте, run, house, be. Навколо нього обертається парадигма поверхневих форм: runs, ran, running. Кожна з них несе той самий основний зміст, але «одягнена» для різної граматичної ролі.3 Словник витрачає свою прозу на лемму, залишаючи тіні вказувати на дім.

Скільки тіней кидає слово, залежить від мови. Англійська є аналітичною: вона покладається на порядок слів і невеликі допоміжні слова, тому дієслово рідко має більше, ніж кілька форм. Фінська є аглоутинативною, вона будує значення, приклеюючи суфікси до основи. Одне фінське іменник інфліктує приблизно в п’ятнадцяти відмінках, у однині та множині, перш ніж на них насипаються присвійні закінчення та клітики; практична кількість різних форм сягає тисяч.4 Угорська упаковує цілий англійський вислів, in my houseв одне слово, házamban.5

02 · Словник, написаний усіма

Де живуть визначення

Визначення походять із Wiktionary, вільного словника, який може редагувати будь-хто. Він енормний і багатомовний: проєкт охоплює понад сотню активних мовних редакцій та десятки мільйонів статей, написаних спільно волонтерами, а не оплаченою редакційною радою.1 Для гри, що працює в 22 мовах, жоден інший вільний лексикон не наближається до нього за охопленням.

Але охоплення на папері — це не те, що можна прочитати вголос. Wiktionary зберігає інфліговані форми таким чином, щоб звільнити людських редакторів від необхідності писати одне й те саме пояснення десять тисяч разів. Замість того, щоб розписувати визначення, стаття, що не є лемою, містить шаблон form-of, невеликий вказівник, який, по суті, каже: «це конкретна граматична форма того лема».2 Запис для smoulders не є прозою; це шаблон, який рендериться як «third-person singular simple present of smoulder».1

Ці вказівники — не похибка округлення. На англійському Вікціонарії з приблизно 1,27 мільйона визначень близько 478 000, тобто значно більше третини, є визначеннями типу «форма» замість повністю розписаних значень.1 Дані є. Вони просто складені.

03 · Проблема розбору, а не прогалина в даних

Глос розгортає шаблон

Тож справжнім викликом ніколи не було «слово відсутнє». Справа в тому, що значення слова ховалося всередині шаблону, який наївний розбірник просто відкинув би. Визначення WordChess створювалися шляхом читання сирих дампів Вікціонарія та розгортання шаблонів відмінювання мова за мовою, навчаючи розбірник, що означає кожна вказівка, і переписуючи її у простий глос.6

Кожна мова ховає свої форми за різним механізмом. Іспанська ховає форми дієслів за {{forma verbo}}, який розгортається у «вербальна форма X». Німецька використовує {{Grundformverweis Dekl/Konj}} для відмінюваних та спряжених форм. Фінська покладається на {{taivutusmuoto}}. Російська часто взагалі не зберігає шаблону форми, інфлексоване слово є «голим» переспрямуванням (собаки → собака), за яким потрібно піти, щоб відновити глос «форми».6 Обробляйте кожну конвенцію, і покриття стрибне.

Покриття визначень, до → після розгортання шаблонів
МоваДоПісляЗростання
Німецька45%92%+47
Нідерландська58%90%+32
Фінська54%74%+20
Російська20%70%+50
Грецька15%57%+42

Виміряно на основі нотаток про дизайн та побудову цього проєкту. Відсотки — це частка словникових записів, що містять придатне визначення або розв’язаний глос «форми».

Дані ніколи не були втрачені. Вони були складені в покажчик, а надання машині слова означало навчання розгортати його.

04 · Що означає «знати слово» для машини

Рядок і речення про нього

Варто бути чесними щодо того, що зараз містить гра. Коли WordChess показує, що собаки є формою собака, «собака», вона нічого не зрозуміла. Вона відобразила один рядок на інший рядок, глос, дотримуючись тих самих посилань, які залишив людський редактор. Це лематизація, робоча конячка обробки природної мови: зведення поверхневої форми до базової, щоб машині довелося відстежувати менше різних речей.7

Це реальний і корисний вид знання. Він дозволяє грі відповідати на питання «що це за слово?» в Афінах чи Амстердамі без лексикографа в штаті. Але це знання-як-пошук, а не знання-як-значення. Глос — це обіцянка, що людина, читаючи його, впізнає слово. Машини тримають обіцянку; читач надає сенс.

Де знаходиться стіна

Деякі мови стикаються з обмеженням, яке жоден парсер не може подолати, оскільки дані просто відсутні для розгортання. Угорські записи часто містять лише етимологію та таблицю перекладів, без жодного тексту визначення, тому навіть ідеальний читач залишається ні з чим. Найскладніші випадки зосереджуються там, де лінгвістика найскладніша: аглютинативні мови, такі як фінська та угорська, які породжують величезні парадигми, а також кирилиця та грецьке письмо, де покриття спільнотою з початку більш тонке. Грецька мова піднялася з 15% до 57%; те, що вона значно поступається німецькій з її 92%, є фактом про джерело, а не про код. 6

Джерела & примітки
  1. Wikipedia, «Wiktionary», масштаб, багатомовна структура, спільне редагування та кількість визначень у форматі «форма слова» (включаючи приклад smoulders ). en.wikipedia.org/wiki/Wiktionary
  2. Wiktionary, «Wiktionary:Form-of templates», як записи, що не є лемами, посилаються на лему в рядку визначення. en.wiktionary.org/wiki/Wiktionary:Form-of_templates
  3. Wikipedia, «Lemma (morphology)», lemma as citation form; the paradigm of inflected forms. en.wikipedia.org/wiki/Lemma_(morphology)
  4. Wikipedia, «Finnish noun cases», the roughly fifteen cases, in singular and plural, before possessive suffixes and clitics stack on top. en.wikipedia.org/wiki/Finnish_noun_cases. Ширший контекст: en.wikipedia.org/wiki/Finnish_grammar
  5. «Morphology of Different Languages», Psychology of Language (BCcampus Open Textbook), аналітична та аглютинативна типологія; приклад házamban . opentextbc.ca/psyclanguage/chapter/morphology-of-different-languages/
  6. Конвеєр визначень WordChess, правила розгортання шаблонів для кожної мови (іспанська {{forma verbo}}, німецька {{Grundformverweis}}, фінська {{taivutusmuoto}}, російські перенаправлення) та показники охоплення. Вимірюється на основі нотаток про проєктування та побудову цього проєкту.
  7. Вікіпедія, «Лематизація», зменшення інфlectованих форм до базової форми в обробці природної мови. en.wikipedia.org/wiki/Lemmatization
  8. Додаткова література на Вікціонарії, [1011.1368] Перетворення структури записів Вікціонарії на таблиці та відносини в схемі реляційної бази даних. arxiv.org.
  9. Додаткова література на Вікціонарії, рівень словникового запасу CEFR як предиктор зацікавленості користувачів записами англійської Вікціонарії. doi.org.
  10. Додаткова література щодо Лематизації, BioLemmatizer: інструмент лематизації для морфологічної обробки біомедичного тексту - PMC. ncbi.nlm.nih.gov.
Was this worth reading?
← Back to WordChess
PlayPendium · About · Contact · Privacy · Terms · Cookies · Accessibility · Copyright · Browse all games · Inspirations · © 2026