Что я делаю с помощью ИИ · Часть 9
Я почти не печатаю: как локальная модель распознавания речи заменила клавиатуру
Этот материал я не напечатал, а наговорил. Как и восемь предыдущих частей сериала.
Сразу оговорюсь, чтобы снять очевидное возражение: печатать я умею, причём вслепую всеми пальцами. Клавиатура у меня вообще полностью английская, русских букв на ней нет, и это никогда не мешало.
Разговор выигрывает не у набора вообще, а у набора в конкретной ситуации: когда надо поставить задачу, объяснить, что не так в результате, или зафиксировать мысль, пока она не ушла.
Почему не облако
Первым делом я смотрел в сторону Яндекса. Их распознавание слышно каждый день в Алисе, и работает оно отлично. Но подключение к нему платное, счёт идёт за минуты, а диктую я помногу и каждый день.
Поэтому модель встала прямо на компьютер. Называется GigaAM, сделал её Сбер, распространяется бесплатно, весит 428 мегабайт.
У локального варианта два следствия, которые я не закладывал, но получил:
- Скорость. Аудио никуда не отправляется, поэтому обработка начинается сразу и не зависит от связи.
- Работает без интернета. В дороге, в самолёте, при упавшем вайфае разницы нет.
Но главное было другое: она хорошо понимает русский. Английские модели на нашей речи коверкают окончания, путают имена и спотыкаются на отчествах, а это ровно то, чем наполнены рабочие надиктовки.
Замеры
| Что | Сколько | |---|---| | Минута речи | около полутора секунд обработки | | Созвон 37 минут | 49 секунд, 28 400 знаков расшифровки | | Короткая фраза | появляется почти сразу, как договорил |
Цифры не из рекламы, а с моего компьютера: обычный рабочий ноутбук, никакой отдельной видеокарты.
Что оказалось важнее качества распознавания
Любая расшифровка ошибается. Вопрос в том, кто разбирается с ошибками.
Прежде чем начать диктовать всерьёз, я записал для ИИ отдельное условие: я говорю голосом, расшифровка местами коверкает слова, учитывай это и не понимай написанное буквально.
Дальше выписал типичные искажения:
- Название программы, в которой я работаю, распознавание упорно слышит как «код код» или «клоуда».
- Глаголы приходят не в той форме: я говорю «проверь», а в тексте оказывается «проверю». То есть поручение превращается в рассказ о планах.
- Микрофон ловит не только меня: в текст попадают обрывки того, что звучит рядом.
Теперь ИИ подставляет правильные слова сам, читает глаголы как поручения и вылавливает посторонние куски. Пару раз он переспрашивал, что делать с заехавшим в надиктовку фрагментом чужого разговора.
Вывод из этого шире, чем про диктовку: систему проще предупредить о своих особенностях, чем добиваться идеального входа.
Что это дало, кроме постов
Созвоны перестали быть мёртвым грузом. Раньше запись часовой встречи лежала мёртвым файлом: пересматривать час ради трёх решений никто не станет. Теперь запись превращается в текст за минуту, а ИИ достаёт из неё план и задачи с именами ответственных.
Задачи ставятся на ходу. Мысль наговаривается в телеграм-бота и сама попадает во входящие. Пока дошёл до машины, три задачи заведены.
Чужие ролики превращаются в навык. Короткую выжимку из видео сегодня бесплатно сделает и Яндекс.Браузер, но задача другая. Я скидываю ролик, где кто-то показывает рабочий приём, ИИ разбирает и речь, и то, что происходит на экране, а потом превращает это в инструкцию для самого себя. Дальше он просто умеет так делать, и объяснять второй раз не нужно.
Последнее стоит подчеркнуть: учусь тут не я, а он.
Зачем это на самом деле
Дело не в скорости, хотя говорю я примерно втрое быстрее, чем печатаю.
Дело в том, что мысль перестала теряться. Идея приходит в дороге, в очереди, между встречами, и раньше она там же и оставалась: доставать ноутбук ради двух абзацев никто не будет. Теперь она проговаривается вслух, а разбирается с ней уже ИИ.
Восемь постов этого сериала я не напечатал. Я их рассказал.
Понравился разбор?
Внедряю ИИ в бизнес и разбираю рынок недвижимости на данных. Обсудим вашу задачу или проект?