Shorts
- 1. Он гонял новый голос от Google на трёх проектах подряд и вечером написал мне одно сообщение, длинное для человека, который обычно отвечает односложно. «Теперь я не знаю, что выбирать, и это хуже, чем когда выбора не было». Раньше решение было одно, теперь их два, и оба звучат разумно, а не как компромисс 2. Первый путь - облако. Голос почти неотличим от живого, придумывается описанием словами, а не выбором из готового списка, и меняется на ходу под настроение ролика без переустановки чего-либо. Работать с ним удобно ровно до момента, когда вспоминаешь: условия использования пишет не ты, а сервис, к которому ты подключился на его правилах, не на своих 3. Второй путь - программа у себя на компьютере. Голос попроще, актёрской игры не жди, зато держится ровно и предсказуемо от файла к файлу. Здесь ты решаешь всё сам: что где хранится, что происходит с текстом, когда что-то обновится и на каких условиях. Компромисс ровно обратный первому пути 4. Разработчик признался, что для рабочих черновиков стал держать оба пути открытыми одновременно, а не выбирать раз и навсегда между ними. Один - для скорости и красоты звучания на презентацию заказчику, второй - для того, что не должно уходить дальше своего диска ни при каких условиях, даже если это медленнее и проще на слух 5. Настоящей ловушки тут нет, есть только два разных набора условий под разные задачи одного и того же человека. Путаница возникает, когда пытаешься найти один правильный ответ вместо того, чтобы честно назвать, что важнее в конкретном случае прямо сейчас - звук или контроль над ним Ты для какой задачи выбрал бы облако, а для какой - свою программу на компьютере?
- 1. Она работает голосом с 2006 года и слышит фальшь в синтезированной речи за долю секунды, обычно не дослушивает демо-ролики дальше первой фразы. Я включил ей запись, не сказал источник. Молчала пятнадцать секунд, потом произнесла: «Это нечестно по отношению к нам, дикторам». Речь была без единой машинной нотки, и она попросила прокрутить сначала 2. Двадцать второго сентября Google открыл для всех две модели озвучки текста, Gemini 3.8 Flash TTS и облегчённую Flash-Lite TTS. Статус - общедоступный релиз, не тест для избранных и не демо для узкого круга разработчиков. Голосов внутри больше двух тысяч, и любой можно не выбирать из списка, а описать словами: низкий, спокойный, с лёгкой хрипотцой, уставший к концу дня 3. Дальше начинается то, из-за чего диктор напряглась по-настоящему. Клон голоса собирается по записи в десять-тридцать секунд, но система требует отдельную запись согласия владельца голоса - без неё клон не выйдет, обойти этот шаг нельзя. В текст можно вписывать смех, вздох, паузу прямо ремаркой, и модель их честно проигрывает, а не читает как обычные слова 4. Языков в Flash TTS сто тридцать, в Flash-Lite сто один, и русский есть у обеих моделей - строка «Russian» стоит прямо в таблице документации, не в пересказе. На готовом файле остаётся неслышная человеку метка SynthID и метка C2PA, доказательство синтетической природы звука вшито в сам файл, а не приклеено сверху 5. Работает это не в привычном чате с Gemini, а через API и Google AI Studio - инструменты для разработчиков, а не кнопка на телефоне у обычного человека. Диктор дослушала до конца и сказала вторую фразу, тише первой: голос перестал быть тем, что легко отличить на слух с первой секунды Ты смог бы на слух отличить живого диктора от этой записи?
- 1. Начал он с признания: «Я всегда смотрел только в шапку репозитория, там же написано license: mit, вопрос закрыт». Вот на этой строчке и ломаются почти все, поэтому шаг первый звучит как запрет: в шапку не смотреть. Она описывает лицензию сборки, самого хранилища, а не того голоса, который ты оттуда вытянул. Три знакомые буквы успокаивают, а проверять ничего не проверяют 2. Шаг второй: искать карточку конкретного голоса. У Piper это отдельный файл MODEL_CARD, он лежит рядом с самим голосом, и каждый голос несёт свою лицензию именно там. Один репозиторий спокойно держит по соседству голос, которым закрывают платные заказы, и голос, которым закрывать их не выйдет 3. Шаг третий, ради которого всё затевалось: из карточки идти на первоисточник датасета, туда, где лежат сами записи речи. Условия назначает тот, кто собрал и отдал голос, а не тот, кто упаковал его в сборку. Дальше читаешь одну строку: CC0 или MIT - работаешь спокойно, NC - оставляешь голос для своего некоммерческого контента 4. Тут монтажёр меня и притормозил: «А сам движок тогда тоже нельзя?». Можно. У Piper сам движок (репозиторий OHF-voice/piper1-gpl, живой, последний push семнадцатого сентября) лежит под GPL-3.0, и эта лицензия накрывает исходный код. Файл со звуком, который движок для тебя посчитал, производным произведением от кода не становится, так что на продажу готовой начитки она не влияет 5. Лицензию кода и лицензию голоса путают чаще всего, причём в обе стороны: одни продают то, чего продавать не имеют права, другие от страха не берут заказ там, где всё чисто. Возьми голос, который прямо сейчас стоит у тебя в папке, и прогони его по маршруту: карточка, датасет, строка лицензии. Уходит на это минуты две, и работает для любого голоса, не только для громких имён А ты знаешь, что написано в лицензии у голоса, которым озвучивал последний свой ролик?
- 1. Речь про ru_RU-ruslan-medium из движка Piper. Его ставят в каждом втором обзоре, потому что он звучит чище соседей и почти не отдаёт металлом. Я полез смотреть, откуда он вообще взялся. Датасет лежит на ruslan-corpus.github.io, и на странице написано дословно: «Corpus is available here (7 Gb) under the CC BY-NC-SA 4.0 license» 2. Две буквы в середине меняют всё. NC значит non-commercial, то есть некоммерческое использование. Брать дᴇньᴦu за результат, сделанный этим голосом, условия лицензии не разрешают. Не «не рекомендуют» и не «лучше уточните», а прямо не разрешают, и написал это тот, кто собрал и отдал корпус речи 3. Вторая половина истории - голоса Silero: aidar, baya, kseniya, xenia, eugene, те самые модели от v4_ru и дальше. Открываешь в репозитории файл LICENSE, читаешь первую строку: «Attribution-NonCommercial-ShareAlike 4.0 International». Те же две буквы, та же граница, только теперь у второго по популярности набора голосов 4. Теперь стоп, без паники и без разоблачений. Я не говорю, что любой бᴇcnᴧᴀᴛный голос под запретом. Годится не каждый - вот точная формулировка. У того же Piper есть denis и dmitri, их датасет OHF-Voice/voice-datasets лежит под CC0, это public domain, подтверждено дословно в README. У Silero есть модели v5_cis_base под MIT, отдельным файлом, русский среди языков присутствует 5. Вся разница между «скачал первое из обзора» и «скачал то, за что спокойно берут плату», умещается в одну строку файла, который никто не открывает, потому что он не про звук. Я свёл это в таблицу: голос, его лицензия, где она физически лежит и годится ли он для платного заказа. Нужна такая таблица - поставь + в комментариях, пришлю лично, ни бота, ни кодовых слов у меня нет А ты хоть раз открывал лицензию у голоса, которым уже озвучивал чужой текст?
- 1. Я открыл одну выдачу на бирже и завис. В ней рядом висят предложения, которые друг друга отрицают. Сверху: «Озвучка текста с помощью ИИ. Любые голоса и языки», автор LesiaLeigh, от 500 рублей, пятьдесят девять отзывов. А через строку: «Живая мужская озвучка БЕЗ нейросетей» и «Дикторская озвучка БЕЗ нейросетей», у второго автора больше тысячи закрытых сделок 2. Заметь, что именно вынесено наверх. Не тембр и не скорость работы, а отсутствие технологии, написанное капсом. Человек продаёт не то, что он умеет, а то, чего он принципиально не делает, и с этим оффером у него тысяча с лишним отзывов за спиной 3. Значит, рынок уже разделился сам, без манифестов и споров в комментариях. Одна половина заказчиков смотрит в ценник и вообще не спрашивает, кто читал текст. Вторая половина доплачивает именно за живого человека и пишет об этом в брифе первой строкой, ещё до обсуждения сроков. Никто их не переубеждает, они просто голосуют кошельком 4. Для того, кто сюда заходит работать, меняется не инструмент, а разговор. Продавать второй половине «у меня нейросеть, это дёшево и быстро» бессмысленно: для неё это минус, а не плюс. Первой половине всё равно, чем сделано, ей важны срок, ударения и чтобы не резало ухо на третьей минуте 5. И всё это в итоге упирается в один честный вопрос: а разница вообще слышна? Мне кажется, за последний год она сократилась сильнее, чем принято считать, но я сужу по себе, а это худшая выборка на свете. Поэтому сегодня в Telegram-канале я вынес это на голосование, там же можно послушать аргументы обеих сторон А ты сам узнаёшь на слух, что текст в ролике читает нейросеть, или давно перестал отличать?
- 1. Разговор был ленивый, между делом. Он усмехнулся: «Начитка чужого текста вслух - мёртвая ниша, туда давно никто не ходит». Спорить я не стал, просто открыл биржу и посчитал сам. Рубрика «Озвучка и дикторы» на Kwork, счётчик живой страницы, снято девятнадцатого сентября: четыреста восемьдесят два заказа 2. Чтобы почувствовать масштаб, рядом стоит соседний раздел. «Создание аудиороликов» на ту же дату держит восемнадцать штук. Разница почти в двадцать семь раз. То, что со стороны выглядит редкой экзотикой, на витрине биржи оказывается бытовой работой, которой прямо сейчас почти пять сотен 3. Дальше я полез в ценник, без всякой романтики. Вход начинается от 500 рублей. Медиана по выборке из двадцати четырёх карточек держится на 750 рублях. Верхняя граница - 6 000 рублей, но там уже живой диктор со студийной обработкой, а не «прочитать абзац вслух». За минуту готового звука медиана та же, 500 рублей 4. И вот цифра, ради которой стоило считать вручную. Из этих 482 кворков метку «нейросеть» несут ровно 35, то есть семь процентов витрины. Синтез речи, который делает минуту звука за минуту работы, лежит в открытом доступе далеко не первый год, а занята им меньше десятой части раздела 5. Состояний тут никто не сколотил, и золотые горы я тебе не обещаю. Но порог входа смешной: диплома диктора не спрашивают, редкий тембр от природы не нужен, микрофон за тридцать тысяч тоже. Почему эти семь процентов не растут быстрее и на чём держится половина тех, кто уже берёт такие заказы, разбираю всю неделю в Telegram-канале А ты бы взялся читать вслух чужой текст за 750 рублей, если бы знал, что таких заказов почти пятьсот?
- 1. Сразу честно: это моё личное правило, не юридическая консультация и не инструкция, что обязан делать именно ты. Просто рамка, которую я вывел для себя за эти месяцы работы с нейросетями - и причина, из-за которой я перестал спорить, окажется проще, чем кажется 2. Ставлю метку там, где кадр реалистичный и без подписи его легко принять за настоящую съёмку или реального человека в реальной ситуации - в Евросоюзе с начала августа именно эту границу закон и проводит, хоть я и не юрист, и это не указание тебе, а то, что укрепило мою же логику. Здесь молчание кажется мне нечестным по отношению к зрителю. А вот со стилизацией история другая 3. Не утруждаюсь там, где и так очевидно, что перед зрителем фантазийная картинка, которую с реальностью спутать невозможно. Дописывать очевидное - не забота о честности, а лишняя суета вокруг того, что и так понятно с первого кадра. И вот тут я подхожу к той самой причине, из-за которой перестал воевать с площадками 4. Они и так умеют читать происхождение файла сами - через метаданные, встроенные подписи инструментов генерации и собственный анализ, который я разбирал несколько дней назад. Спорить с системой, которая всё равно сделает по-своему, бессмысленно, а моя энергия нужнее на текст запроса 5. Так и закрываю эту неделю - метка это не про страх, а про уважение к тому, кто смотрит. С понедельника можно применять эту же рамку к своим роликам. А то, что накопилось за неделю по теме, лежит у меня в сообществе А у тебя уже есть своё правило, когда подписывать нейросеть под кадром, или каждый раз решаешь заново?
- 1. Дед всю жизнь проявлял плёнку сам, и когда я показал ему заголовок про метки на нейросетях, он усмехнулся: «Мы это делали руками ещё до вашей техники». Оказалось, в его мастерской на обороте отпечатка честно писали, что именно тронуто в проявке. Дальше он сказал фразу, из-за которой я и взялся за этот ролик 2. «Заказчик имеет право знать, что перед ним - чистый кадр или доработанный». Никакого наказания в этом не было, просто договорённость: если что-то изменено, об этом не молчат, а пишут прямо на обороте. Ровно эта договорённость всплыла в моей ленте на этой неделе, только с датами и цифрами 3. Одна видеоплощадка помечает синтетику сама с 2024 года, другая примерно тогда же подключила метки, которые остаются в файле даже после скачивания. С начала августа в силе закон, который требует раскрывать реалистичный синтетический контент. Ничего из этого не свалилось внезапно - просто дедовская привычка наконец добралась до техники в промышленных масштабах 4. Смысл у неё ровно дедовский, а не карательный. Метка не отбирает кадр и не портит его - она просто честно говорит, каким способом он сделан, а зрителю оставляет решать, интересно ему это смотреть или нет. И вот к какому выводу это меня в итоге привело 5. Так что я не вижу в этом драмы, только продолжение старой договорённости между тем, кто делает кадр, и тем, кто на него смотрит. Разбор всей этой темы неделя за неделей веду в Telegram-канале, там подробнее по каждому пункту А в твоей семье был кто-то, кто честно писал на обороте фотографии, что в ней подправлено - или это правило изобрели только сейчас?
- 1. Он работает с видеоплатформами и слышит один и тот же вопрос: «Если я просто не поставлю галочку про ИИ при загрузке, откуда вообще узнают?». Ответ его каждый раз удивляет людей: галочка - это самый слабый из источников, а не единственный 2. Первый источник сильнее любой галочки - метка внутри самого файла. Одна крупная площадка первой среди видеосервисов подключила систему таких меток, она остаётся в файле даже после скачивания, и её можно проверить сторонним инструментом, а не только внутренним алгоритмом. И это всего лишь первый из трёх слоёв, которые он назвал 3. Второй источник - собственные системы платформы. По официальной справке одной из них, метка ставится автоматически в трёх случаях: контент сделан её же инструментами ИИ, в файле нашлись технические данные о генерации, или внутренний анализ сам определил признаки синтетики. Третий источник он приберёг напоследок, и он оказался самым неожиданным 4. Помимо метаданных многие инструменты генерации и съёмки подписывают файл на своей стороне, ещё до того, как он попал на площадку. Так что подпись может стоять уже в момент создания, а не появляться только после загрузки. Дальше он честно добавил одну оговорку, без которой картина была бы неполной 5. Ни один из этих слоёв не работает идеально, и говорить, что теперь ловят вообще всё - было бы нечестно. Но раз источников несколько и они дублируют друг друга, рассчитывать только на отсутствие галочки уже не выйдет. Разбор похожих приёмов лежит у меня в сообществе, ссылку оставляю в Telegram-канале А ты раньше считал, что не отметил ИИ при загрузке - значит точно никто не узнает, или уже догадывался, что источников больше одного?
- 1. Он монтирует ролики на нейросетях и сказал одну вещь, которая мне запомнилась: «Девяносто процентов моей работы - не генерация, а склейка кадров так, чтобы зритель не заметил, что лицо чуть плывёт». Спросил, откуда вообще берётся этот сдвиг, если промпт от кадра к кадру один и тот же 2. Ответ был простой. Персонаж собирают из одного-двух исходных фото, а дальше просто просят нейросеть повторить его в новой сцене. Модели нечего сверять, кроме собственной догадки, и на третьем кадре черты лица начинают жить своей жизнью. У тех, кто с этим не сталкивается, набор для генерации собран совсем иначе 3. Ракурсы анфас и профиль, разное освещение, разная мимика, иногда даже отдельно руки и типичные позы. Не один портрет для галочки, а маленькая картотека, по которой нейросеть сверяет себя на каждом кадре. И вот что удивительно - промпт при этом почти не меняется 4. Разница не в формулировке запроса, а в том, что подложено под неё до старта генерации. Слабый набор референсов - слабый персонаж, каким бы длинным и умным ни был текст запроса. Собрать сильный набор оказывается не сложнее, а просто дольше 5. Собрать такую картотеку руками - работа на вечер, зато потом персонаж не разваливается от сцены к сцене и держит внимание, а не отвлекает на себя ошибками. Дальше можно менять сцены, одежду и фон сколько угодно - лицо остаётся собой. Как именно искать и подбирать такие референсы, я разложил отдельно и выложил в Telegram-канале А у тебя нейроперсонаж уже держит форму от кадра к кадру, или на третьей сцене лицо начинает жить своей жизнью?
- 1. Разговорились случайно, он работает с новой линейкой телефонов. Сказал буднично: «Сенсор подписывает кадр в момент съёмки, а облачная система превращает это в неизменяемый эталон рядом с обычным снимком». Я переспросил, зачем это вообще нужно, если раньше никто и не проверял, откуда взялась картинка 2. А проверяют уже давно, просто тихо. Ещё с 2024 года одна крупная видеоплощадка помечает ролик сама, без участия автора, если распознаёт в нём признаки нейросети или встроенные технические метки файла. Другая площадка на видео первой из всех подключила систему меток, которая остаётся в файле даже после скачивания и читается сторонним инструментом. И это только то, что тихо работало годами - на этой неделе добавилось кое-что новое 3. В Евросоюзе с начала августа действует правило: реалистичный синтетический контент обязан быть раскрыт как такой, даже если никого не хотели обмануть. Российский музыкальный сервис на днях объявил про инструменты прозрачности и потребовал от правообладателей честно сообщать, использовали ли они нейросеть. Но самый неожиданный участник этой цепочки - даже не сервис, а кусок железа 4. В этот четверг в продаже появится телефон, который создаёт подписанный эталон прямо в момент нажатия на затвор - сама Apple сравнивает это с цифровым негативом. Работает только на топовой паре моделей, а сторонние приложения смогут показывать эталон через отдельный API. И вот тут стоит остановиться и честно спросить себя, что из этого реально значит для тебя, а не только для инженеров 5. Ни одна из этих систем не ловит идеально, и говорить, что теперь узнают всегда и всё - нечестно перед фактами. Но сходится слишком много всего сразу: площадки, закон, сервисы, теперь и сама камера. Прятать происхождение кадра тихо и молча больше не получится, и это просто новая данность, с которой предстоит работать. Всю эту неделю разбираю тему в Telegram-канале А ты сам обычно подписываешь, что в ролике или на фото поработала нейросеть - или молчишь и надеешься, что вопрос никто не задаст?
- 1. Присказка простая. На этикетке банки нарисован полный дом гостей и разварная каша до краёв, а по факту из этой банки выходит половина миски и совсем не то фото. Бабушка не ругала производителя, она просто говорила - картинку рисуют художники, а варить тебе. Смотри не на банку, а в кастрюлю 2. На этой неделе я поймал ровно тот же сюжет. Google выпустил новую модель распознавания речи, в анонсе обещано - убирает слова-паразиты, все эти э-э и а-а, сама причёсывает текст. Красивая банка. Я взял свой кусок настоящего вебинара и заглянул в кастрюлю 3. В кастрюле было двенадцать паразитов а-а и э-э на пятиминутном куске, а у старого доброго Whisper на том же месте - ноль. Не потому что модель плохая, а потому что рекламная строчка и твой русский файл живут в разных мирах. На картинке гости, в миске половина порции 4. Жанр этот знаком каждому, кто хоть раз повёлся на упаковку. На коробке крупно обещано именно то, чего тебе не хватает, а внутри оказывается ровно та же проблема, с которой ты и пришёл. На этикетке всегда праздник, в кастрюле как получится 5. Так что с недели забирайте одну бабушкину привычку. Выходит громкая новинка, обещает золотые горы - не веришь на слово и не машешь рукой, а берёшь свой обычный файл и смотришь глазами, пятнадцать минут. Работает не только с расшифровкой, а с любой программой, которая себя нахваливает. Тему транскрибации на этом закрываю, со следующей недели новый сюжет, а весь разбор способов остаётся в Telegram-канале А ты по жизни больше веришь этикетке или всё-таки заглядываешь в кастрюлю, прежде чем звать гостей?
- 1. Сначала где именно. Не на самой расшифровке - способ давно известен и работает: звук переводится в текст прямо на твоём компьютере, файл никуда не уходит, лимитов нет, русский нормальный. Люди встают на шаг раньше - на моменте, когда эту программу надо один раз завести у себя 2. Что там за шаг. Часть настройки идёт через командную строку - чёрное окно, куда вводишь команды текстом. Для человека, который открыл его впервые, это стоп-сигнал: непонятно, что писать, и страшно что-нибудь сломать. Вот здесь очередь и упирается, хотя по факту там пара действий 3. Вторая ловушка - вспомогательная программа для работы со звуком, которую надо доставить рядом. Короткие инструкции из интернета про неё обычно молчат, и тогда всё падает с непонятной ошибкой. Человек решает, что у него руки не оттуда, и закрывает тему. А дело было в одном недостающем куске 4. Почему это вообще не про ум. Инструкции пишут для своих - для тех, кто такое окно видит каждый день. Проведи новичка по каждому экрану, покажи, куда нажать и что вставить в чёрное окно, и та же самая настройка перестаёт быть преградой. Уходит на неё один вечер, если не гадать, а повторять по порядку 5. И вот вывод. Облачные новинки берут удобством разметки, но для чистого читаемого русского текста локальный путь на своём компьютере остаётся выбором по умолчанию - и мешает ему ровно этот первый шаг. Как пройти его и не споткнуться, у меня разобрано отдельно. А разбор самих путей, какой куда ведёт и где у каждого подвох, я на неделе выложил в Telegram-канале А ты свои записи занятий уже переводишь в текст на компьютере - или пока стоишь перед этим чёрным окном и не решаешься на первый шаг?
- 1. В официальном блоге Google про новую модель распознавания речи стоит дословно - removes filler words, то есть убирает слова-паразиты, все эти ums и ahs, и сама форматирует текст. Именно за это обещание я и взялся, потому что после слов стенографистки поверить в него стало труднее 2. Условия я подобрал так, чтобы спорить было не о чем. Один звуковой файл - начало настоящего вебинара с платного курса. Один и тот же кусок на пять минут. Whisper этот кусок уже разбирал раньше, его текст лежал у меня готовым, новинке я скормил ровно то же самое через Google AI Studio. Дальше никакой экспертизы, просто поиск по двум текстам: сколько раз встречается а-а и сколько э-э. Двенадцать у новинки, ноль у Whisper 3. Вот три куска прямо из выдачи новой модели, дословно. Давайте начнём с э-э вос- вспоминания. Тем лучше она составляет а-а ответ. У этого а-а промпта есть четыре а-а смысловых части. То, что в анонсе названо вычищенной речью, на моём русском файле выглядит вот так 4. Теперь честно про обратную сторону, без перекоса. Смысл модель передала точно, термины вроде нулевого доверия и промпт не переврала, выдуманных фраз не насочиняла. И структура у неё из коробки приятнее - сразу заголовок с таймкодом, в интерфейсе есть переключатели разметки по ролям и таймкода на каждое слово. У голого Whisper этого сходу нет, и это честный плюс новинки 5. Оговорюсь, чтобы не выдавать это за приговор. Я прогнал один отрывок, один файл, один прогон, и спикер там был один - работу разметки по ролям на этом куске я вообще не проверял. Но по своей задаче вывод сложился: маркетинг обещает, файл показывает, а для чистого русского текста мне пока проще остаться на Whisper. Как завести его у себя и не споткнуться, у меня разобрано отдельно - сегодня без ссылок, просто чтобы вы знали, что способ есть А ты обычно проверяешь громкую цифру из анонса на своём файле - или берёшь её на веру, раз уж так написано в официальном блоге?
- 1. Как я ошибался. Читал сравнение, где у инструмента низкая ошибка распознавания, ставил его - и на своём вебинаре получал кашу. Потому что в обзоре брали чужой файл, чужой язык и чистую студийную запись. Мой звук другой: спикер частит, микрофон средний, в кадре термины из ниши. Чужой тест мне про мой звук ничего не говорил 2. Что делаю теперь, шаг первый. Беру один и тот же кусок минут на пять из реальной записи, где есть и живая речь, и пара специальных слов из моей темы. Не весь файл - короткий отрывок, чтобы прогнать несколько раз и не ждать по часу каждый заход 3. Шаг второй. Прогоняю этот кусок через все инструменты, которые сравниваю. Один и тот же звук, один и тот же отрывок, никаких поблажек ни одному из них. Дальше просто смотрю выдачи рядом 4. Шаг третий - три оси. Первая: термины и имена, не переврал ли инструмент специальные слова, фамилии, названия. Вторая: мусор, сколько осталось обрывков слов, повторов и запинок вида э-э и а-а - это видно глазами, а можно посчитать поиском. Третья: структура, есть ли абзацы, знаки препинания, таймкоды, пометки про говорящих 5. По сумме трёх осей сразу видно, что подходит именно мне - не по рейтингу из статьи, а по моему звуку. Способ простой и живёт годами: выйдет через год следующая громкая модель - прогоню её тем же способом за те же пятнадцать минут. Полный разбор путей с таблицей по этим осям выложил в Telegram-канале, там же ссылка на подробную статью А ты выбираешь транскрибатор по обзору с чужим файлом - или потратишь пятнадцать минут и проверишь его на своей записи?
- 1. Путь первый - онлайн-сервис, куда грузишь файл через браузер. Быстро и без возни. Расплата: запись со всеми фамилиями, внутренними названиями и цифрами уезжает на чужой сервер, и что там с ней дальше - вопрос без ответа. Плюс лимиты по минутам, а вебинар редко бывает коротким 2. Путь второй - встроенные субтитры видеоплатформы. Ничего не стоит и лежит прямо под роликом. Расплата: на русском это часто каша из ошибок, без запятых и абзацев. Формально текст под роликом есть, а читать его тяжело и отдать нейросети под свой вопрос почти нечего 3. Путь третий - модель, которая работает прямо на твоём компьютере и никуда файл не отправляет. По приватности вопросов нет вообще, звук со двора никуда не уходит. Расплата: её надо один раз завести у себя, и вот здесь обрывается большинство - пугает чёрное окно с командами, хотя там пара действий 4. Дальше это сводится в одну таблицу - что каждый путь даёт, где у него лимит, где каша на русском, куда именно уезжает твой файл и кто теоретически может его прочитать. Не рейтинг, где одна строчка решает за тебя, а раскладка по колонкам, чтобы выбрать осознанно, а не методом тыка 5. И вот тут выясняется главное - куда уезжает файл, ты обычно не знаешь до того, как заглянешь в эту таблицу. Всю раскладку по трём путям и их подвохам я на неделе собрал и выложил в Telegram-канале - целиком, с примерами по каждому пункту. В ролик всё не уместить, подробное там А ты сейчас каким путём переводишь свои занятия в текст - и знаешь точно, куда при этом уходит файл с записью, или об этом просто не думаешь?
- 1. Каждый второй разговор про перевод занятий в текст начинается с вопроса про диаризацию - это когда в тексте помечено, кто именно сейчас говорит, и стоят таймкоды на каждую реплику. Штука красивая, спорить не буду. Весь вопрос в том, нужна ли она конкретно тебе 2. Где она правда решает, я не спорю. Интервью на два голоса, запись планёрки на десять человек, спор в эфире, который потом режут по репликам. Там каждая фраза обязана быть прибита к своему автору, иначе текст рассыпается. Это отдельный класс задач 3. А теперь обычная учебная запись. Один спикер говорит два часа, изредка зачитывает вопрос из чата. Плашка спикер один тут ничего не добавляет. Нужен чистый текст, по которому можно пробежать глазами или отдать нейросети под свой вопрос. Обрывки слов, повторы и лишние а-а мешают такому тексту сильнее, чем отсутствие пометки о говорящем 4. Новинки любят выносить эту разметку на первый экран анонса, потому что в демонстрации она смотрится эффектно. На днях я прогнал громкую облачную модель и Whisper на одном и том же куске - первые пять минут настоящего вебинара с платного курса. Разметка у новинки из коробки удобнее, тут честно. А по чистоте русского текста на этом отрывке я насчитал у неё двенадцать запинок вида а-а против нуля у Whisper 5. Отсюда моя позиция. Сначала посчитай, сколько живых голосов реально в твоих файлах, и только потом гонись за таймкодом на каждую реплику. Для учебных записей с одним лектором читаемость важнее разметки, и дорогой сервис с блестящей диаризацией легко закрывает задачу, которой у тебя нет. Всю эту неделю разбираю тему в Telegram-канале, день за днём А тебе в расшифровке занятия что важнее - чистый читаемый текст без мусора или разметка, кто говорит, с таймкодами на реплики?
- 1. Он рассказал это между двумя заездами, буднично. Человек приезжает с распечаткой, где производитель обещает расход пять литров и тишину в салоне. Приёмщик кивает, загоняет машину на пост, цепляет диагностику - и почти всегда картина другая, чем на глянцевой странице. Не потому что кто-то соврал, а потому что буклет писали не про этот двор и не про эту манеру езды 2. Дальше он делает одну вещь и советует её каждому. Не спорит с буклетом и не выбрасывает его, а сверяет обещание с конкретной машиной перед собой. Пятнадцать минут на стенде отвечают на вопрос точнее, чем сто отзывов на форуме, где у людей другой год выпуска и другие дороги. Обещание проверяется на твоём железе, а не на чужом 3. Я поймал себя на том, что с новыми программами делаю ровно наоборот. Вышла громкая модель распознавания речи, в анонсе написано - убирает запинки и сама причёсывает текст. Звучит как то, чего я хочу каждую неделю, когда разгребаю записи занятий. И хочется поверить строчке 4. Поэтому я сделал как приёмщик. Взял свой рабочий файл - первые пять минут настоящего вебинара с платного курса - и прогнал этот кусок через новинку и через Whisper, которым пользуюсь давно. Один звук, один отрывок, дальше просто считаю запинки руками. На этом куске у новой модели их набралось двенадцать, у Whisper на том же месте - ноль. Ровно наоборот тому, что стояло в анонсе 5. Вывод из этого шире расшифровки. Любое громкое обещание - про почту, про планировщик, про очередную нейросеть для заметок - проверяется на твоём материале за несколько минут, а не принимается на веру и не отвергается с ходу. Полторы минуты своей проверки стоят больше десяти обзоров, где брали чужой файл на чужом языке. Всю эту неделю разбираю тему в Telegram-канале, кусок за куском А ты обычно проверяешь громкое обещание из рекламы на своём примере - или веришь строчке на сайте, пока не упрёшься в то, что на деле вышло иначе?
- 1. Он рассказал это между заказами, со смехом. В первую неделю сентября, говорит, очередь бодрая - студенты берут кофе, обсуждают расписание, у всех блокноты, ноутбуки и планы ходить на всё. Он сказал: в эти дни у людей даже осанка другая, будто год точно будет не как прошлый 2. К октябрю картина, по его словам, меняется. Тот же народ берёт стакан побольше, говорит тише, а на вопрос как учёба отвечает - надо будет засесть на выходных. Бариста уверяет, что фразу про выходные слышит от одних и тех же людей месяцами, и выходные каждый раз какие-то другие 3. Он говорит, что взрослые с ноутбуками ведут себя так же. Сидят с вебинаром в наушниках, в сентябре конспектируют, к ноябрю просто ставят на паузу и уходят в ленту. Запись копится, чувство долга копится, а сил открыть её вечером уже нет - те же сутки, та же усталость 4. Бариста в этом смысле философ. Он сказал: не бывает так, что человек взял и пересмотрел сорок часов записей силой воли, за десять лет ни разу такого не видел. Кто справляется, тот не геройствует, а просто иначе всё устроил, чтобы занятие само превращалось во что-то короткое и понятное. Остальные носят долг с собой, как я ношу поднос 5. Смешно, но он прав. Первая неделя всегда про то, что теперь-то всё будет иначе, а меняется это только к следующему сентябрю. Единственное честное окно что-то поправить - как раз сейчас, пока запал не остыл и записей всего пара штук. С понедельника, кстати, разговоры про расшифровку лекций в канале сворачиваются А на этой первой неделе ты тоже ходишь самым собранным - или уже ловишь себя на мысли посмотрю на выходных?
- 1. Разговор был за столом, между делом. Внук пожаловался, что не успевает записывать за преподавателем - тот тараторит, слайды мелькают, к концу пары в тетради каша. Дед послушал и сказал: запись, которую ты делаешь на бегу и ни разу потом не открываешь, это не запись, а способ занять руки 2. Он объяснил на своём опыте. Полвека назад он так же строчил конспекты, гордился толстыми тетрадями, а на экзамене понимал, что помнит только те темы, где отложил ручку и просто слушал. То, что записано под диктовку, в голове не оседает - через тебя проходит звук, а не смысл. Свои тетради он потом ни разу не перечитал 3. Дед сказал, что сейчас и проще, чем в его годы, и тяжелее. Проще - потому что занятие можно сохранить целиком, не надеясь на почерк. Тяжелее - потому что это сохранённое копится тоннами и создаёт иллюзию, что ты всё потом учтёшь. Папка с двадцатью записями успокаивает ровно до того дня, когда по ним надо готовиться 4. Штука в том, что дедовское наблюдение не про возраст и не про вуз. Оно ровно так же работает на школьном уроке и на вечернем вебинаре у того, кто учится после работы. Живое занятие уходит, а остаётся ощущение, что важное там было, и папка, куда это важное складывали 5. К сессии внук понял, что дед имел в виду. Записать больше или красивее - не та задача. Задача в том, чтобы занятие после себя оставляло не туман и не гору снимков, а что-то, к чему можно вернуться и правда найти нужное. Толстая тетрадь этому не помогает, она просто тяжелее А у тебя от прошлого года что осталось от лекций и вебинаров - рабочие записи, к которым ты возвращался, или папки, которые с тех пор ни разу не открывались?
