Science to Supersize Understanding

Один мозговой имплантат объединяет речь и жесты для управления аватаром

В эксперименте с людьми с параличом удалось одновременно декодировать два способа общения. Ключевым стало обучение на совмещённых попытках; доступный набор выражений пока ограничен.

Figura científica mostra sinais cerebrais alimentando dois decodificadores, um avatar que acena e gráficos de acerto para fala e gestos.
Изображение: S. C. Brosler, J. R. Liu, A. B. Silva e colegas / Nature Neuroscience, figura 5. CC BY 4.0 (https://creativecommons.org/licenses/by/4.0/). Sem alterações.

Leitura autorizada · 3 crédito(s) restante(s)

Редакционный анализ SUPER SCI-Z

Приветствие может сочетать слово и взмах руки, но научить мозговой интерфейс распознавать их одновременно — не значит просто соединить две программы, работающие по отдельности. Команда Калифорнийского университета в Сан-Франциско показала, что один имплантат может давать сигналы для параллельного декодирования речи и жестов и управления цифровым образом пользователя. Исследование Саманты Брослер, Джесси Лю, Александра Силвы и коллег опубликовано 14 сентября в Nature Neuroscience. Возможность продемонстрирована в заданиях с заранее заданными вариантами, пока далёких от свободного разговора.

Исследователи записывали активность мозга трёх людей с разной степенью паралича. У каждого на поверхности мозга располагалась сетка из 253 электродов, охватывавшая области, связанные с речью и движениями. Этот метод, электрокортикография, регистрирует электрические сигналы популяций нейронов. В демонстрациях с аватаром и заданиях, совмещавших речь и жесты, участвовали двое: человек с параличом после инсульта ствола мозга и человек с боковым амиотрофическим склерозом — заболеванием, поражающим нейроны, отвечающие за движение.

По подсказкам на экране участники, в зависимости от своих возможностей, пытались произносить фразы, выполнять или представлять жесты либо совмещать оба действия. Две модели машинного обучения получали сигналы одного имплантата: одна классифицировала фразы, другая — жесты. Распознанная фраза появлялась в виде текста, а аватар махал рукой, двигал головой или выполнял другой выбранный жест. Команда поступала цифровому телу; движения парализованного тела эксперимент не восстановил.

Трудности возникли, когда модели, обученные только на отдельных попытках речи или жестов, должны были распознавать одновременные попытки. Часть электродов реагировала на оба поведения, и зарегистрированные при их сочетании паттерны распознавались хуже. Добавление одновременных примеров в обучение улучшило результат. Ещё одна настройка научила каждую модель не выдавать ответ, когда присутствовала только другая модальность: например, классификатор речи усвоил, что отдельная попытка помахать рукой не должна превращаться во фразу.

В одновременном тесте в реальном времени у участника с боковым амиотрофическим склерозом система правильно распознала 70% фраз и 66% жестов при десяти вариантах каждого типа и дополнительном классе покоя. 95-процентные доверительные интервалы, отражающие неопределённость оценок, составили 63,5–76% для речи и 59,5–72,5% для жестов. Ориентир для случайного выбора из одиннадцати классов составлял примерно 9,1%. Это отдельные показатели: они не означают, что в 70% попыток одновременно правильно определялись и фраза, и жест.

Главный вклад работы — показать, как обучать интерфейс поведению, сосуществующему в общении. Жест может дополнять фразу или сам служить ответом, расширяя выразительные возможности аватара. Чтобы превратить демонстрацию в повседневный инструмент, необходимо расширить репертуар, сократить задержку ответов и проверить работу у большего числа людей. Исследованная система также зависит от проводного соединения имплантата с внешним оборудованием.

03

Главные выводы

  • Один имплантат давал сигналы для параллельного декодирования речи и жестов; аватаром пользовались два участника.
  • В одновременном тесте с десятью фразами и десятью жестами точность у одного участника составила 70% и 66% соответственно.
  • Обучение на совмещённых действиях снизило помехи, но репертуар, выборка и оборудование пока ограничивают повседневное применение.
Основной источникNature Neuroscience

Комментарии

Опубликованных комментариев пока нет.

Войдите с подпиской, чтобы комментировать.