Что я делаю с помощью ИИ · Часть 9

Я почти не печатаю: как локальная модель распознавания речи заменила клавиатуру

6 сентября 2026Кирилл Кривицкий
Я почти не печатаю: как локальная модель распознавания речи заменила клавиатуру
Содержание
  1. Почему не облако
  2. Замеры
  3. Что оказалось важнее качества распознавания
  4. Что это дало, кроме постов
  5. Зачем это на самом деле

Этот материал я не напечатал, а наговорил. Как и восемь предыдущих частей сериала.

Сразу оговорюсь, чтобы снять очевидное возражение: печатать я умею, причём вслепую всеми пальцами. Клавиатура у меня вообще полностью английская, русских букв на ней нет, и это никогда не мешало.

Разговор выигрывает не у набора вообще, а у набора в конкретной ситуации: когда надо поставить задачу, объяснить, что не так в результате, или зафиксировать мысль, пока она не ушла.

Почему не облако

Первым делом я смотрел в сторону Яндекса. Их распознавание слышно каждый день в Алисе, и работает оно отлично. Но подключение к нему платное, счёт идёт за минуты, а диктую я помногу и каждый день.

Поэтому модель встала прямо на компьютер. Называется GigaAM, сделал её Сбер, распространяется бесплатно, весит 428 мегабайт.

Модель распознавания речи работает прямо на ноутбуке, без облака и оплаты за минуты
Модель распознавания речи работает прямо на ноутбуке, без облака и оплаты за минуты

У локального варианта два следствия, которые я не закладывал, но получил:

  • Скорость. Аудио никуда не отправляется, поэтому обработка начинается сразу и не зависит от связи.
  • Работает без интернета. В дороге, в самолёте, при упавшем вайфае разницы нет.

Но главное было другое: она хорошо понимает русский. Английские модели на нашей речи коверкают окончания, путают имена и спотыкаются на отчествах, а это ровно то, чем наполнены рабочие надиктовки.

Замеры

ЧтоСколько
Минута речиоколо полутора секунд обработки
Созвон 37 минут49 секунд, 28 400 знаков расшифровки
Короткая фразапоявляется почти сразу, как договорил

Цифры не из рекламы, а с моего компьютера: обычный рабочий ноутбук, никакой отдельной видеокарты.

Что оказалось важнее качества распознавания

Любая расшифровка ошибается. Вопрос в том, кто разбирается с ошибками.

Прежде чем начать диктовать всерьёз, я записал для ИИ отдельное условие: я говорю голосом, расшифровка местами коверкает слова, учитывай это и не понимай написанное буквально.

Дальше выписал типичные искажения:

  • Название программы, в которой я работаю, распознавание упорно слышит как «код код» или «клоуда».
  • Глаголы приходят не в той форме: я говорю «проверь», а в тексте оказывается «проверю». То есть поручение превращается в рассказ о планах.
  • Микрофон ловит не только меня: в текст попадают обрывки того, что звучит рядом.

Теперь ИИ подставляет правильные слова сам, читает глаголы как поручения и вылавливает посторонние куски. Пару раз он переспрашивал, что делать с заехавшим в надиктовку фрагментом чужого разговора.

ИИ сам исправляет искажённые слова, читает глаголы как поручения и вылавливает чужие обрывки
ИИ сам исправляет искажённые слова, читает глаголы как поручения и вылавливает чужие обрывки

Вывод из этого шире, чем про диктовку: систему проще предупредить о своих особенностях, чем добиваться идеального входа.

Что это дало, кроме постов

Созвоны перестали быть мёртвым грузом. Раньше запись часовой встречи лежала мёртвым файлом: пересматривать час ради трёх решений никто не станет. Теперь запись превращается в текст за минуту, а ИИ достаёт из неё план и задачи с именами ответственных.

Задачи ставятся на ходу. Мысль наговаривается в телеграм-бота и сама попадает во входящие. Пока дошёл до машины, три задачи заведены.

Чужие ролики превращаются в навык. Короткую выжимку из видео сегодня бесплатно сделает и Яндекс.Браузер, но задача другая. Я скидываю ролик, где кто-то показывает рабочий приём, ИИ разбирает и речь, и то, что происходит на экране, а потом превращает это в инструкцию для самого себя. Дальше он просто умеет так делать, и объяснять второй раз не нужно.

Последнее стоит подчеркнуть: учусь тут не я, а он.

Зачем это на самом деле

Дело не в скорости, хотя говорю я примерно втрое быстрее, чем печатаю.

Дело в том, что мысль перестала теряться. Идея приходит в дороге, в очереди, между встречами, и раньше она там же и оставалась: доставать ноутбук ради двух абзацев никто не будет. Теперь она проговаривается вслух, а разбирается с ней уже ИИ.

Идея, пришедшая в дороге или в очереди, проговаривается вслух, и дальше с ней разбирается ИИ
Идея, пришедшая в дороге или в очереди, проговаривается вслух, и дальше с ней разбирается ИИ

Восемь постов этого сериала я не напечатал. Я их рассказал.

Понравился разбор?

Внедряю ИИ в бизнес и разбираю рынок недвижимости на данных. Обсудим вашу задачу или проект?

← Все материалы