Практика / AI-видеоХорошее AI-видео
начинается до промпта
Действие, камера, свет. Разбираем сцену по кадрам и собираем запрос, который можно повторить.
Разобраться с видеогенерациейНейросети в деле. И в удовольствие.
Найти свой инструментLive Avatar совмещает голос с видеоаватаром. В анонсе Google от 24 сентября функция адресована корпоративным пользователям.
Экспериментальный помощник предлагает токены, а основная модель проверяет их. Ускорение зависит от железа и доли времени на обработку картинки.
Что опубликовано в репозитории, где находится демо и какие выводы пока рано делать.
Официальные сайты, открытый код и ограничения до первого запуска.
Запуск языковых моделей на своём компьютере и API для приложений.
Сборка генерации картинок и других AI-процессов из связанных узлов.
Локальное распознавание речи на основе Whisper.
Площадка с интерактивными демо моделей и приложений.
Гайды, фишки и эксперименты, к которым хочется вернуться.

Небольшие задачи с понятным результатом. У каждой есть первый шаг и способ проверить, что получилось.

Разбираем схему по входу, преобразованию и результату. Что сохранять и что проверять в чужом файле.

Ollama, LM Studio и веб-интерфейс: выбираем первый шаг, модель и задачу для проверки.
Понятный план для whisper.cpp: исходный файл, короткая проба и проверка расшифровки.

Порядок проверки результата апскейла: фактура, лица, буквы и сравнение с исходником.

Небольшой тест без голосования за любимый бренд: одинаковые входные данные и понятные критерии.