Исследователи представили новую большую языковую модель
Исследователи представили генеративную модель Apollo Restore, которую они создали для того, чтобы работать с древнегреческими текстами. Она способна на приемлемом уровне заполнять лакуны в текстах, записанных на папирусах, даже в тех случаях, когда нет данных о том, какое количество символов утрачено. О своей разработке исследователи пишут в препринте статьи, выложенном на сайте arXiv.org.
В библиотеках и музеях по всему миру хранится огромное количество эпиграфических памятников и папирусов, относящихся к эпохе Античности. В общей сложности в Средиземноморье и на Ближнем Востоке исследователи нашли больше миллиона папирусов, тексты которых в основном написаны на древнегреческом языке в период между 300 годом до нашей эры и 700 годом нашей эры. Большинство из них сохранились до наших дней в виде фрагментов, содержащих различное количество лакун.
Заполнение лакун в папирусах — как правило, сложная задача, которая может потребовать от специалистов огромного количества времени на работу. По этой причине неудивительно, что примерно за полтора века научных исследований лингвисты опубликовали всего около восьми процентов сохранившихся папирусов, то есть около миллиона документов остаются непрочитанными в полной мере.
На помощь ученым в последние годы пришли большие языковые модели, и лингвисты, работающие с древними текстами, не стали исключением. На этот раз Хоуп Макговерн (Hope McGovern) вместе с коллегами из компании Mistral AI, Австрийской академии наук и Северо-Восточного университета в Бостоне представила еще один такой инструмент — новую генеративную модель, получившую название Apollo Restore. Этот инструмент исследователи создали для того, чтобы работать с древнегреческими текстами, в том числе с папирусами. В отличие от эпиграфических памятников, где часто можно уверенно предсказать по длине лакуны, какое количество символов пропущено, такой подход плохо работает с папирусами.
Специалисты обучили модель Apollo Restore на текстах, состоящих примерно из 600 миллионов слов, записанных на греческом языке, начиная с эпохи Античности и заканчивая 1900 годом нашей эры (больше двух третей материалов относилось к периоду до 1453 года, то есть до падения Константинополя). Для обучения они использовали как документы и литературные тексты, так и эпиграфические памятники, которые были представлены примерно 156 тысячами надписей. В своей работе исследователи исходили из принципа, что модель должна заполнять лакуны даже без указания примерного количества пропущенных символов, опираясь на текст до и после — принцип Fill-in-the-Middle.
Тестирование новой модели показало ее заметное преимущество над другими разработками, включая известные модели Ithaca (для работы с эпиграфическими памятниками) и Cullhed (для работы с папирусами). По данным исследователей, Apollo Restore достигает точности 80,6 процента при заполнении лакун в документах, 54,6 процента — в литературных текстах и 61 процента — в эпиграфических памятниках, если длина лакуны составляет от одного до десяти символов. Это примерно в 1,4–2,6 раза лучше, чем у других моделей. При этом, если речь идет о лакунах длиной до 20 символов, то преимущество Apollo Restore возрастает до 1,6–3,5 раза.
Для того, чтобы проверить разработанную модель, исследователи также провели эксперименты, для которых они привлекли 20 специалистов в области филологии, эпиграфики и папирологии, занимающихся древнегреческими текстами. Они вслепую оценивали результаты, которые получены с помощью разных больших языковых моделей, а также оценивали то, как Apollo Restore предлагал исправления для ранее опубликованных текстов. В частности, в ходе последних тестов эксперты примерно в одном из шести случаев предпочли вариант прочтения от языковой модели, а не общепринятый опубликованный вариант.
В прошлом году специалисты из компании Google DeepMind представили другую генеративную модель — Aeneas. Они создали ее для работы с эпиграфическими памятниками, созданными на латинском языке. По задумке исследователей, она должна стать хорошим помощником для лингвистов и историков, работающих с древними надписями.