Точность достигла 94 процентов
Британские исследователи научили алгоритмы машинного обучения распознавать джазовых пианистов по их уникальному стилю игры. Наилучший результат показала сверточная нейросеть. Она определяла исполнителя ранее не встречавшейся записи с точностью более 94 процента. Кроме того, исследователи разработали модель, которая отдельно анализирует мелодию, гармонию, ритм и динамику произведения, что дает возможность оценить вклад этих компонентов в индивидуальный стиль музыкантов. Статья опубликована в журнале Nature Machine Intelligence. Исследователи сделали веб-приложение, в котором можно послушать характерные особенности игры каждого из 20 пианистов.
У каждого художника, писателя или композитора есть набор приемов, по которым его работу можно узнать. В живописи, например, это выбор сюжета, цветовая палитра и манера наложения мазков, а в литературе — привычные автору синтаксические конструкции, излюбленные слова и повествовательные приемы. В музыкальной сфере в роли «почерка» выступают гармонические последовательности, ритмические структуры и мелодические обороты. Вместе такие приметы образуют отпечаток, по которому специалисты могут определить автора или исполнителя произведения. Вот только вручную такие исследования идут медленно, а часть особых примет — например, микроскопические отклонения в ритме — и вовсе могут ускользать от человека.
Исследователи под руководством Питера Харрисона (Peter Harrison) из Кембриджского университета решили применить методы машинного обучения для обнаружения творческих отпечатков в джазе. В качестве исходных данных они использовали набор из 84 часов записей выступлений 20 исполнителей, включая Билла Эванса, Оскара Питерсона, Телониуса Монка и Кита Джарретта. В набор данных входили как сольные записи, так и выступления в составе трио. Исходные аудиофайлы в наборе данных конвертированы в формат MIDI — по сути, в нотную запись, где для каждой ноты сохраняется информация о высоте, громкости, моменте начала и окончания. Такой формат сохраняет мелодические, гармонические, ритмические и динамические особенности исполнения, но при этом убирает из обучающей выборки неважные данные, которые могут повлиять на результат — вроде условий звукозаписи или звучания рояля конкретной модели.
Для извлечения информации о творческом «почерке» пианистов исследователи применили два подхода. В первом для поиска характерных мелодических фрагментов и аккордов использовались классические алгоритмы машинного обучения — случайный лес, метод опорных векторов и логистическая регрессия. Из каждой записи выделяли короткие мелодические обороты и созвучия, а потом сравнивали, кто из пианистов пользуется ими чаще. Общие для всех музыкантов обороты не учитывались. Второй подход основан на сверточных нейронных сетях. Модели обучали на 30-секундных фрагментах, представленных в виде двумерного аналога перфорированного рулона для механического пианино. На нем по одной оси откладывалось время, а по другой — высота ноты. Чтобы избежать переобучения, авторы меняли высоту нот, время их начала, длительность, громкость и положение 30-секундных фрагментов внутри записи. Вычисления выполнялись на одной видеокарте NVIDIA A100.
Из классических методов лучше всего показала себя логистическая регрессия — с ее помощью удалось определить исполнителя в 77 процентах случаев. Хотя итоговая точность сравнительно низкая, метод позволил увидеть, какие именно приемы используют конкретные музыканты. Например, в игре Билла Эванса алгоритм выделил нисходящие арпеджио септаккордов, которые этот музыкант использовал чаще других — в записях такая последовательность встречается 128 раз, тогда как у других пианистов существенно реже. У Оскара Питерсона модель отметила прием опевания целевых нот, при котором музыкант подходит к нужной ноте через соседние с ней более высокие и низкие звуки. Оба наблюдения совпадают с тем, что пишут о стиле этих пианистов эксперты в области исследования музыки.
Среди нейросетевых моделей лучшей оказалась сверточная нейросеть ResNet с 50 слоями. Для каждого 30-секундного фрагмента она оценивала вероятность того, что его сыграл каждый из 20 пианистов, после чего результаты одной записи усреднялись. Такая модель правильно угадывала исполнителя в ранее не встречавшихся ей записях в 94,4 процента случаев. Для отдельных фрагментов точность составляла 80,5 процента. Однако оказалось, что работа такой нейросети плохо интерпретируется — сложно понять, какие именно приемы в игре пианиста становятся решающими при принятии решения о его личности. Поэтому исследователи разработали более интепретируемую архитектуру. Они выделили из исходных данных четыре представления, отвечающих за мелодию, гармонию, ритм и динамику исполнения. Каждое из них обрабатывала отдельная подсеть, после чего полученные признаки объединялись.
Лучшая версия такой модели достигла точности 91,3 процента. Отключая по очереди подсети и наблюдая за падением точности, исследователи оценили вклад разных составляющих исполнения. Выяснилось, что только по одной гармонии — сочетанию одновременно звучащих нот — удается распознать пианиста в 74 процентах случаев. Наибольшую дополнительную информацию дает ритм, а наименьшую — динамика. В будущем разработчики алгоритма планируют расширить набор анализируемых инструментов и применить подход к изучению творчества других исполнителей.
Нейросети можно использовать для того, воссоздать звук по беззвучному видео игры на фортепиано. Американские разработчики представили такой алгоритм в 2020 году.
Исследование проводили в Австралии
Марио Сьерво (Mario Siervo) из Университета Кертина с коллегами из Австралии, Великобритании, Канады и Таиланда провел кросс-секционное исследование и пришел к выводу, что для студентов, которые уделяют видеоиграм более 10 часов в неделю, характерны повышенная масса тела и более низкое качество диеты и сна. В работе приняли участие 317 студентов австралийских университетов (медианный возраст 20 лет, 60,6 процента — женщины). Все они заполнили опросники по физиологическим и демографическим характеристикам, состоянию здоровья, проводимому за видеоиграми времени, физической активности, уровню стресса, качеству сна и рациону питания. Статистическую обработку данных проводили методом множественной линейной регрессии с поправками на пол, этническую принадлежность, курение, употребление алкоголя, прием лекарств, занятость и другие факторы. Результаты опубликованы в журнале Nutrition.