Есть задача, которую люди формулируют десятком разных способов, а решают одним движением. Одни ищут, как заставить фото говорить. Другие хотят сделать говорящее видео из снимка. Третьи пишут в поиске «цифровой аватар», потому что им нужен ведущий для роликов, а сниматься на камеру не тянет. Задача у всех одна: взять неподвижную фотографию и получить видео, где человек с неё произносит нужный текст. Говорящий аватар делается за пару минут прямо в чате телеграма. Ниже разбор: где взять голос, что нажимать в боте и почему на половине снимков губы всё-таки плывут.
Коротко: нужны два файла, фотография и аудиозапись с голосом. Открываете бота, жмёте «Создать видео», выбираете «Липсинк», отправляете фото, следом аудио и подтверждаете кнопкой «Начать генерацию». Нейросеть синхронизирует губы и мимику с речью и возвращает видео. Голос удобнее всего собрать в том же боте из текста, он вернёт готовый файл. Ролик тянется до пяти минут, монтаж не нужен. Одна деталь, на которой спотыкаются все: голосовое сообщение Липсинк не принимает, звук нужен именно файлом.
- Готовый рецепт: что именно отправлять боту
- Какая нейросеть подойдёт для говорящего аватара
- Что понадобится
- Как сделать говорящий аватар: пошаговая инструкция
- Шаг 1. Соберите аудио с голосом
- Шаг 2. Зайдите в озвучку текста
- Шаг 3. Выберите голос
- Шаг 4. Отправьте текст с ремаркой тона
- Шаг 5. Откройте Липсинк
- Шаг 6. Отправьте фотографию
- Шаг 7. Следом отправьте аудио
- Шаг 8. Нажмите «Начать генерацию»
- Шаг 9. Заберите ролик
- Что получится в результате
- Почему один аватар жестикулирует, а другой нет
- Цифровой аватар: кому он на самом деле нужен
- Поздравление голосом любимого артиста: что тут можно, а что нельзя
- Как изменить сценарий под себя
- Частые ошибки и как их избежать
- Частые вопросы
- Как заставить фото говорить?
- Какая нейросеть делает говорящие аватары?
- Можно ли сделать говорящий аватар бесплатно?
- Можно ли использовать свой голос?
- Говорящий аватар из фото это дипфейк и это законно?
- Говорящий аватар работает на русском языке?
- Чем это отличается от аватарки для профиля?
- Сделайте так, чтобы фото заговорило
Готовый рецепт: что именно отправлять боту
Главная особенность этой задачи в том, что промпт тут почти не решает. Нейросети не нужно объяснять, что делать с портретом, ей нужен звук: она разбирает речь по звукам и подгоняет под них движение рта. Поэтому копировать вы будете не промпт, а заготовку речи.
Вот две заготовки, обе можно отдать боту как есть. Слова перед двоеточием задают тон, вслух они не звучат. Первая под ведущего, который обращается к аудитории:
Спокойный уверенный голос: Здравствуйте! Меня не существует. Я фотография, которую нейросеть научила говорить. Ни камеры, ни студии, ни съёмочной группы: один снимок и записанный голос. Попробуйте сами.
Вторая под личное поздравление, самый частый бытовой сценарий:
Тёплый, радостный голос: Мам, привет! С днём рождения тебя. Я тебя очень люблю и в эти выходные обязательно приеду.
А это промпт для самого Липсинка. Он необязательный, но с ним человек в кадре ведёт себя живее:
Человек говорит в камеру, естественная мимика, лёгкие кивки головой, взгляд в объектив. Полностью сохранить черты лица.
Если на снимке видно руки, добавьте в промпт жестикуляцию, и ролик станет заметно живее:
Человек говорит в камеру, естественная мимика, спокойная жестикуляция руками в такт речи, лёгкие кивки головой, взгляд в объектив. Полностью сохранить черты лица.
Разберём, почему эти заготовки работают:
- Ремарка тона перед репликой это самый недооценённый приём во всей озвучке. Модель управляемая: напишите «тихо, с придыханием» или «низкий эпичный голос диктора», и подача изменится. Без ремарки получите ровное дикторское чтение, годное для инструкции и мёртвое для поздравления.
- Короткие фразы с обычными знаками препинания. Аббревиатуры, цифры вперемешку с текстом и длинные периоды со скобками сбивают синтез, и в этих местах губы начинают жить своей жизнью.
- Одно обращение вместо трёх. Первый ролик стоит делать на двух или трёх предложениях. Так вы за минуту поймёте, ложится ли ваше фото под эту задачу, и не заплатите за пятиминутный монолог с уехавшим лицом.
- «Полностью сохранить черты лица» в промпте Липсинка работает как страховка. Инструмент и так двигает в основном рот, но на слабом исходнике эта строчка заметно уменьшает шанс, что человек к концу ролика превратится в своего дальнего родственника.
Какая нейросеть подойдёт для говорящего аватара
Видеомоделей в боте много, и половина из них к этой задаче отношения не имеет. Смотреть надо на одно: умеет ли инструмент брать лицо с готовой фотографии и класть на него именно вашу речь.
| Инструмент | Что подаёте на вход | Для чего подходит |
|---|---|---|
| Липсинк | Фото и аудио с голосом | Основной выбор. Губы и мимика синхронизируются с записью, ролик тянется до пяти минут. Годится и для фотографии, и для готового видео |
| Kling Motion | Фото и видео-референс | Отдельная большая тема: копирует на человека с фото поведение из вашего ролика. Разберём в отдельном материале |
| Veo 3.1 | Фото и промпт | Сам синтезирует речь и звук по описанию сцены. Ролик всего восемь секунд и цена высокая, зато отдельная озвучка не нужна |
| Seedance 2 | Фото и промпт | Соседняя задача: движение и эмоция без конкретной речи. Этим оживляют архивные снимки |
| Sora 2 | Фото без людей и промпт | Не подходит. Людей с фотографии в кадр не берёт, лицо со снимка не перенесёт |
Весь дальнейший гайд про Липсинк. Он делает ровно то, за чем сюда приходят: снимок начинает говорить голосом с вашей записи, и ничего кроме фотографии и звука от вас не требуется.
Что понадобится
- Телеграм и бот Нейрочаты, ничего устанавливать не нужно.
- Одна фотография. Лицо анфас или с небольшим поворотом, крупно в кадре, без тёмных очков и чёлки на глаза. Профиль не годится: инструменту нечего синхронизировать, если рта почти не видно.
- В кадре должен быть один человек. На групповом снимке нейросеть выберет говорящего сама, и это будет не тот, на кого вы рассчитывали.
- Аудиозапись с голосом до пяти минут, обязательно файлом. Чистая, без музыки и уличного шума. Годятся mp3, wav и m4a, то есть всё, что выдаёт обычный диктофон на телефоне. А вот голосовое сообщение из переписки не подойдёт, и об эту мель разбивается большинство первых попыток.
Голоса под рукой нет? Соберите его в том же боте из текста, это соседний раздел и отдельного сервиса не требуется. Если же снимок старый и потрёпанный, сначала прогоните его через реставрацию старого фото: чем чётче лицо на входе, тем точнее ложится синхронизация.
Как сделать говорящий аватар: пошаговая инструкция
Шаг 1. Соберите аудио с голосом
Самый быстрый путь это собрать голос прямо в боте: он вернёт готовый файл в нужном формате, и думать больше не о чем. Откройте Нейрочаты и выберите «Работа с аудио», а там «Озвучка текста».
Хотите свой голос, записывайте не голосовым в переписку, а диктофоном на телефоне. Он сохранит mp3 или m4a, оба формата бот принимает. Почему так, разберу на седьмом шаге.

Шаг 2. Зайдите в озвучку текста
В разделе аудио четыре кнопки. Нужна «Озвучка текста»: это она превращает написанное в речь. Соседняя «Расшифровка голоса» работает наоборот и здесь не нужна.

Шаг 3. Выберите голос
Нажмите «Выбрать голос». Женских три: Мэри звучит твёрдо и уверенно, София молодо и живо, Анна мягко и уютно. Мужских тоже три: Эндрю энергичный, Шерон с дикторским деловым тембром, Дейв солидный. Под поздравление лучше всего идёт София, она звучит моложе и живее остальных. Анна мягче и подходит для спокойного, почти домашнего обращения, а для делового ролика берите Шерона.

Бот покажет все шесть с короткими описаниями. Голос меняется в любой момент, так что первый выбор ни к чему не обязывает.

Шаг 4. Отправьте текст с ремаркой тона
Скопируйте заготовку из блока выше и отправьте её обычным сообщением. Ремарка перед двоеточием задаёт подачу и вслух не читается. Через несколько секунд бот вернёт аудиофайл, его и понадобится скормить Липсинку.
Шаг 5. Откройте Липсинк
Вернитесь в главное меню, нажмите «Создать видео» и в списке моделей выберите «Липсинк». Это именно видеораздел, хотя на входе у вас фотография.

Шаг 6. Отправьте фотографию
Прикрепите снимок. Промпт про мимику вставляется подписью к фото, в том же сообщении. Отдельным сообщением его слать не нужно, бот принимает картинку и текст одной отправкой.

Шаг 7. Следом отправьте аудио
Бот ответит, что фото добавил, и попросит аудио. Это подтверждение, что снимок принят.

Отправьте файл, который получился на четвёртом шаге, Телеграм спросит подтверждение, соглашайтесь. Именно файл, и это не придирка к формулировке.
Голосовые Липсинк не принимает. Наговорить прямо в переписку не выйдет, и файл в формате ogg он тоже развернёт. Причина одна на два случая: голосовые в Телеграме это и есть ogg. Работают mp3, wav и m4a, то есть всё, что пишет диктофон на телефоне. Озвучка текста внутри бота отдаёт wav, так что при работе через неё вопрос не встаёт вовсе.

Шаг 8. Нажмите «Начать генерацию»
Оба файла на месте, и бот показывает, во сколько обойдётся ролик. Вот тут внимательнее: сам он ничего не запускает и будет ждать вашего подтверждения сколько угодно. Пока не нажата зелёная кнопка, ничего не происходит и ничего не списывается. Рядом есть «Изменить промпт», если передумали насчёт мимики.

Шаг 9. Заберите ролик
Дальше можно закрыть переписку и заняться своими делами, готовое видео придёт сообщением. Расход считается посекундно, поэтому реплика на несколько секунд обходится в разы дешевле минутного монолога.
Что получится в результате
На выходе видео, где человек со снимка произносит ваш текст: губы двигаются под звук, лицо живёт, голова слегка покачивается. Фотография при этом остаётся узнаваемой, потому что инструмент двигает лицо, а не рисует его заново.
Куда это идёт дальше:
- Видеопоздравление. Самый частый сценарий: фотография именинника, тёплый текст, отправка в семейный чат.
- Одно фото превращается в постоянного ведущего для ваших роликов. Сниматься не нужно, свет ставить тоже, а выглядеть при этом можно так, как на самой удачной своей фотографии.
- Обучающие видео. Тут выигрыш в другом: заменить одну фразу в курсе проще, чем переснимать дубль.
Почему один аватар жестикулирует, а другой нет
Посмотрите ещё раз на ролик выше. Героиня говорит, улыбается, поворачивает голову, а руки как лежали на столе, так и лежат. Поломки тут нет: в промпте её ни о чём таком не просили, да и поза сама по себе спокойная.
А вот другой кадр, снятый в полный рост, и в промпте добавлена одна строчка про жестикуляцию:
Руки разошлись, пошла жестикуляция под речь, человек держится как ведущий перед камерой. Мимикой дело не ограничилось: Липсинк оживил всё, что было в кадре.
Разница между двумя роликами складывается из двух вещей сразу, и обе в вашей власти. Первая это кадр: на портрете по плечи рук нет физически, оживлять там нечего. Вторая это промпт: молча нейросеть выбирает спокойный вариант и оставляет позу как есть.
Правило простое: инструмент работает только с тем, что попало на фотографию. На портрете по плечи рук просто нет, и никакой промпт их не дорисует, там вы получите говорящую голову. Нужны жесты, берите снимок, где руки видны и свободны, а не сложены на коленях или на столе, и попросите жестикуляцию прямо в промпте.
Оговорка тут одна. Попросить жестикуляцию вы можете, а вот выбрать, какой именно будет жест, уже нет: рисунок движения нейросеть придумывает сама. Выйдет живо, но не обязательно так, как рисовалось в голове. Для поздравления, обращения к подписчикам или разговорного ролика это неважно. Если же нужно повторить строго определённое движение, задача решается другим инструментом, и о нём будет отдельный разбор.
Цифровой аватар: кому он на самом деле нужен
Цифровой аватар это ваш видеодвойник, собранный нейросетью: он говорит вашим голосом или голосом синтеза, выглядит как вы на фотографии и снимается без камеры. Технически это та же самая синхронизация губ со звуком, просто задача звучит солиднее.
Спрос на него держится ровно и заметно растёт к зиме: только по прямым запросам про говорящих и цифровых аватаров в Яндексе набирается около четырёх тысяч обращений в месяц, а в январе цифра удваивается. Причина не в моде на технологии. Причина в том, что видео стало обязательным форматом, а сниматься на камеру большинство людей по-прежнему не любит и не умеет.
Кому это закрывает боль в первую очередь:
- Экспертам и блогерам, у которых текст есть, а желания включать камеру нет.
- Специалистам по соцсетям, которым нужен поток коротких роликов при нулевом бюджете на съёмку.
- Продавцам и рекрутёрам. Персональное видеообращение открывают чаще, чем письмо с тем же текстом (и это, честно говоря, единственная причина, по которой их вообще смотрят).
- И тем, кто делает подарки. Ожившее и заговорившее фото попадает в человека сильнее открытки.
Поздравление голосом любимого артиста: что тут можно, а что нельзя
Отдельная история, ради которой в эту тему приходит много людей. Поздравление от знаменитости ищут около двух тысяч раз в месяц, отдельно ищут западный сервис, где такое поздравление заказывают за деньги. Соблазн понятный: взять фотографию артиста и заставить её поздравить маму с юбилеем.
Техническая правда в том, что полноценно это всё равно не выйдет. Голос конкретного артиста взять неоткуда: бот синтезирует речь своими голосами, а клонирования чужого тембра в нём нет. То есть звезда на видео заговорит не своим голосом, и всё волшебство рассыпается на первой же секунде.
И правовая сторона. Изображение человека защищено статьёй 152.1 Гражданского кодекса: публиковать чужое лицо без согласия нельзя, и артисты этим правом пользуются. Отдельная охрана голоса пока существует только в виде законопроекта, но на изображение это никак не влияет. Сделать такое видео для себя и показать в кругу семьи никто не запретит. Выкладывать в ленту, продавать как услугу или ставить в рекламу не стоит.
Рабочий вариант оказывается лучше исходной задумки: поздравление вашим собственным голосом от лица человека, которого адресат знает и любит. Своё фото, свой голос, свои слова. Это и законно, и трогает сильнее, чем чужая знаменитость, читающая шаблон.
Как изменить сценарий под себя
Менять здесь нужно текст озвучки, а не промпт. Вот что стоит попробовать в заготовке из первого блока:
- Замените «Тёплый, радостный голос» на «Спокойный уверенный голос», если делаете деловой ролик, а не поздравление.
- Поставьте «Тихо, с придыханием» для интимной, личной интонации. Хорошо работает на коротких фразах в две строки.
- Впишите «Низкий эпичный голос диктора», если собираете драматичный ролик под трейлер или анонс.
- В промпт Липсинка добавьте «человек улыбается в конце фразы», чтобы ролик не заканчивался каменным лицом.
- Уберите из промпта «лёгкие кивки головой», если снимок сделан очень крупно: на портрете во весь кадр кивок читается как рывок.
Частые ошибки и как их избежать
Главная ошибка: отправить оба файла и уйти, не нажав «Начать генерацию». Бот показывает цену и ждёт подтверждения, сам он ничего не запускает. Отсюда растёт половина жалоб «отправил всё, а бот не работает».
- Голосовое вместо файла. Самая частая осечка, потому что наговорить в переписку быстрее всего и рука тянется сама. Не пройдёт ни голосовое, ни файл в ogg. Шлите mp3, wav или m4a.
- Надежда, что нейросеть сама придумает текст. Липсинк не сочиняет речь, он подгоняет губы под готовый звук. Нет аудио, нет и ролика.
- Музыка или шум в записи. Инструмент пытается синхронизировать губы со всем, что слышит, и на фоновой музыке рот начинает плыть. Голос должен звучать один.
- Лицо в профиль или мелко в кадре. Синхронизировать нечего, если рот занимает несколько пикселей. Обрежьте фотографию так, чтобы лицо занимало заметную часть кадра.
- Замах на пятиминутный монолог с первой попытки. Стоит он соответственно, а лицо на такой дистанции успевает устать. Отработайте связку на паре предложений и только потом делайте полную версию.
- Обрезанный по подбородок портрет. Нейросети нужен запас кадра, чтобы голова могла шевелиться. На плотном кропе она либо стоит колом, либо начинает елозить вместе с фоном.
- Попытка сделать это в Sora 2. Модель не берёт людей с фотографии, туда отправляют кадры без людей. Лицо со снимка оживит именно Липсинк.
Частые вопросы
Как заставить фото говорить?
Нужны два файла: фотография и аудиозапись с речью. В боте это раздел «Создать видео», кнопка «Липсинк». Отправляете снимок, следом аудио, нейросеть разбирает речь по звукам и подгоняет под них движение губ и мимику. Отдельной программы и монтажа не требуется, всё происходит в переписке, а готовый ролик приходит сообщением.
Какая нейросеть делает говорящие аватары?
Основной инструмент это Липсинк: он работает от звука, синхронизирует губы с вашей аудиозаписью и тянет ролик до пяти минут. Veo 3.1 умеет синтезировать речь сам, отдельная озвучка ему не нужна, но выдаёт он всего восемь секунд и стоит заметно дороже. Seedance 2 решает соседнюю задачу, движение и эмоцию без конкретных слов, им оживляют архивные снимки. Sora 2 для этого не годится, людей с фотографии она в кадр не берёт.
Можно ли сделать говорящий аватар бесплатно?
Совсем бесплатно не выйдет. Приветственного бонуса новым пользователям хватает примерно на одну генерацию картинки, а видео стоит заметно дороже. Зато расход прямо зависит от длины: считается посекундно, поэтому реплика на десять секунд обойдётся в разы дешевле минутного монолога. Отрабатывать связку разумно на коротких фразах.
Можно ли использовать свой голос?
Да, и на личных поздравлениях свой голос заметно живее синтеза. Записывайте только не голосовым в переписку: их Липсинк не принимает, как и формат ogg, а голосовое в Телеграме это он и есть. Пишите диктофоном и отправляйте файлом, подойдут mp3, wav и m4a. Требование к записи одно, чистый звук без музыки и шума. Синтез удобнее там, где текст меняется часто и наговаривать его заново каждый раз лень.
Говорящий аватар из фото это дипфейк и это законно?
Технология та же, а вопрос законности решает не она, а чьё лицо на снимке. Своё фото, фото близкого с его согласия, купленный сток: делайте что хотите. Чужое лицо без разрешения защищено статьёй 152.1 Гражданского кодекса, и публикация такого ролика это уже нарушение. Граница проходит не по инструменту, а по согласию человека в кадре.
Говорящий аватар работает на русском языке?
Да, синхронизация идёт по звуку, а не по языку, поэтому русская речь ложится так же точно. Голоса для озвучки в боте тоже русские, шесть штук, три женских и три мужских. Промпт и текст пишутся по-русски, переводить ничего не нужно.
Чем это отличается от аватарки для профиля?
Это разные вещи, которые называются похоже. Аватарка для профиля это статичная картинка, стилизованный портрет в кружке мессенджера, и делают её в разделе создания фото. Говорящий аватар это видео, где человек с фотографии произносит текст. Нужна именно картинка для профиля, вам в раздел создания фото, и там своя механика: как сделать портрет по фото в нейросети, разобрано отдельно.
Сделайте так, чтобы фото заговорило
Возьмите любой портрет, напишите три предложения и получите говорящий аватар за пару минут. Откройте Нейрочаты, выберите «Создать видео», затем «Липсинк», отправьте фотографию, а следом аудио с голосом.
Соседний сценарий на тех же снимках: как оживить фото нейросетью, когда речь не нужна, а нужны движение и эмоция. Вместе с реставрацией это полный путь старой карточки: починить, оживить, заставить говорить.
Автор: Александр, проект «AI Мастерская». Все шаги и настройки из этой статьи протестированы лично, ролики в материале сделаны по описанным шагам. Героиня примеров сгенерирована специально для статьи: показывать чужие настоящие лица в теме про цифровых двойников я считаю неправильным. Обновлено: июль 2026.







