Руководство пользователя

Всё, что нужно знать о настройке и работе с Чик-Чик.

1. Системные требования

Операционная система Windows 10/11 (x64)
macOS 11.0+ (Big Sur и новее)
Процессор (CPU) Любой многоядерный процессор (Intel Core i3 / AMD Ryzen 3 и выше).
Поддержка Apple Silicon (M1/M2/M3/M4/M5) — нативная.
Оперативная память (RAM) Минимум: 8 ГБ (нужно для транскрипции Whisper)
Рекомендуется: 16 ГБ (для длинных видео 1ч+ и тяжёлых моделей)
Видеокарта (GPU) Не требуется (достаточно встроенной графики)
Интернет Требуется для AI-функций (Упаковка, Обложки) и авторизации.
Монтаж и локальная транскрипция Whisper работают полностью офлайн.
Свободное место ~300 МБ на программу + модель Whisper (скачивается один раз): рекомендуемая ~800 МБ, максимальная ~1.5 ГБ + место для ваших видеофайлов

Совет: Для максимальной скорости работы рекомендуем хранить исходные видеофайлы на SSD диске.

2. Установка и запуск

  1. Скачайте файл ChikChik_Setup.exe с главной страницы.
  2. Запустите установщик. Windows может показать предупреждение SmartScreen — нажмите "Подробнее" -> "Выполнить в любом случае".
  3. После установки на рабочем столе появится иконка Чик-Чик. Запустите её.
  1. Скачайте архив для macOS.
  2. Распакуйте архив (кликните дважды по .zip файлу).
  3. Запустите появившееся приложение ChikChik.
  4. Важно при первом запуске:
    Если macOS заблокирует запуск ("Не удается проверить разработчика"):
    • Откройте Системные настройки -> Конфиденциальность и безопасность.
    • Прокрутите вниз до раздела "Безопасность".
    • Нажмите кнопку "Подтвердить вход" или "Открыть все равно".
  5. При первом монтаже: Система может попросить доступ к файлам. Обязательно нажмите "Разрешить".

3. Авторизация

Мы используем вход через Telegram. Оплата и управление подпиской происходят внутри бота.

01

QR-код

На экране появится QR-код. Наведите на него камеру телефона или нажмите кнопку "Войти через Telegram".

02

Бот @ChikChikAuthBot

Откроется бот. Нажмите "Старт" для активации.
Оплата подписки и покупка слотов происходит прямо в диалоге с ботом.

03

Готово

Программа автоматически запустится, если у вас есть подписка или активен пробный период (3 дня).

Условия подписки

  • Пробный период: Первые 3 дня бесплатно. Если вы планируете использовать программу дальше, необходимо оплатить подписку в боте.
  • Лимит устройств: Одна подписка = 1 устройство.
  • Дополнительные слоты: Хотите работать и на ПК, и на ноутбуке? В меню бота можно докупить дополнительные слоты для устройств.
  • Токены: ИИ-функции приложения — генерация SEO в «Упаковке», идеи заголовков и генерация обложек — расходуют токены с вашего баланса. Стоимость каждого действия видна прямо в интерфейсе перед запуском. Локальная транскрипция Whisper работает офлайн и токенов не тратит. Пополнить баланс можно в боте Telegram или на сайте.

Монтаж

Загрузите записи с камер и микрофонов — программа сама смонтирует видео по звуку, переключая ракурсы, как живой режиссёр.

4. Настройка проекта

Разбор основных функций программы.

Общий план
Несколько файлов

Включите этот тумблер, если запись с общей камеры разбита на несколько файлов (например, 001.MP4, 002.MP4).

Спикеры

Добавьте от 1 до 7 спикеров. Для каждого укажите:

  • Имя: Название для дорожки в монтажной программе.
  • Цвет: Окраска дорожки на таймлайне (Premiere Pro).
  • Видео: Слот для видеофайлов.
    Можно загрузить один файл или несколько (если была остановка записи или используется мультикамера).
    Для загрузки нескольких файлов включите тумблер "Несколько файлов" под слотом.
  • Звук: Слот для отдельной аудиодорожки (опционально).
    Если слот пустой, программа возьмет звук из видеофайла.
  • Аудиоканал (L / R / Моно): НОВОЕ
    Под слотом «Звук» находятся два дропдауна:
    Источник видео — из какого файла брать звук: «Своё видео», «Общий план» или видео другого спикера.
    Канал — какой канал использовать: Моно (весь сигнал), Левый (L) или Правый (R).

    Это полезно, если звук спикера записан в L или R канал видеофайла другого спикера. Выберите нужный файл в «Источнике» и укажите канал — программа извлечёт именно этот сигнал.
Ведущий

Приоритет в спорах и право перебивать общий план.

Режим одного спикера

Снимаете себя на несколько камер (блог, экспертный контент)? Добавьте всего одного спикера — и программа смонтирует мультикам-видео с одного «говорящего», автоматически переключая ракурсы и разбавляя картинку общим планом.

В этом режиме программа сама отключает лишние настройки (перебивки, задержку переключения, паузу между общими планами) — они нужны только для диалогов нескольких участников. Интерфейс остаётся чистым.

5. Алгоритмы монтажа

Настройки "характера" вашего автоматического режиссера.

Время плана спикера

10 – 13 сек
Зачем это нужно: Чтобы зритель не заскучал, глядя на одну «говорящую голову».
Как работает: Задаётся диапазоном (например, 10–13 сек). При каждом переключении программа выбирает случайное значение из этого интервала — монтаж получается «живым» и непредсказуемым. Когда спикер говорит непрерывно дольше выбранного значения, камера переключается на общий план.

Время общего плана

8 – 12 сек
Зачем это нужно: Защита от эффекта «стробоскопа» (мелькания) и чтобы зритель успел рассмотреть сцену.
Как работает: Тоже задаётся диапазоном — левая ручка — минимальное время удержания общего плана, правая — максимальное. Фактическая длительность выбирается случайно. Даже если кто-то начал говорить, камера не дёрнется обратно мгновенно.

Ротация камер

10 – 20 сек
Условие: Появляется, только если у спикера загружено несколько ракурсов (включён режим «Несколько файлов» — мультикамера или разрыв записи).
Как работает: Вы задаёте диапазон (например, от 10 до 20 сек). Программа будет переключать ракурсы в случайный момент времени внутри этого интервала, чтобы монтаж выглядел естественным и не монотонным.

Порог перебивания

5 сек
Приоритет ведущего. Появляется, только если одному из спикеров назначена роль «Ведущий».
Обычно программа держит общий план положенное время. Но Ведущий имеет право «сорвать» камеру на себя раньше.
Чем меньше значение — тем агрессивнее Ведущий захватывает эфир.

Порог разделения голосов

8 дБ
Рекомендация: Оставьте 8 дБ (оптимально для 90% случаев).
Как работает: Это защита от ложных срабатываний. Программа переключит камеру, только если новый спикер громче текущего на это значение.
Когда уменьшать (3-5 дБ): Если программа «тормозит» и не успевает за быстрыми диалогами (студийный звук).
Когда повышать (12-15 дБ): Если программа хаотично прыгает из-за эха или вздохов соседа.

Пауза между общими планами НОВОЕ

30 сек
Зачем это нужно: Чтобы общий план не появлялся слишком часто и не приедался.
Как работает: После каждого показа общего плана программа выжидает заданное время, прежде чем показать его снова. Чем больше значение — тем реже зритель видит «дальний» ракурс.

Задержка переключения НОВОЕ

0.30 – 0.60 сек
Блок «Естественность монтажа»
Зачем это нужно: Живой режиссёр реагирует не мгновенно — он переключает камеру с лёгкой задержкой.
Как работает: Когда заговорил новый спикер, программа не режет ровно в ту же миллисекунду, а ждёт случайный момент внутри диапазона (по умолчанию 0.30–0.60 сек). 0 сек — мгновенная реакция. Монтаж перестаёт быть «роботизированным».

Перебивки на слушающего НОВОЕ

Включить реакции
Зачем это нужно: Чтобы монтаж был живым, нужно иногда показывать не говорящего, а того, кто слушает и реагирует (кивает, улыбается).
Как работает: Пока один спикер долго говорит, программа изредка вставляет короткую «перебивку» на лицо слушателя. Настраивается:
Вероятность — насколько часто вставлять реакцию (0–100%).
Длина перебивки — диапазон длительности (1.5–2.5 сек).
Мин. интервал — пауза между реакциями (60–300 сек).
Не раньше (сек речи) — реакция не вставляется, пока спикер не говорит хотя бы это время.
Доступно только при 2+ спикерах.

AI Распознавание спикеров НОВОЕ

ИИ-определение говорящего
Зачем это нужно: Обычный алгоритм определяет, кто говорит, по громкости. В сложных условиях (эхо, перекрёстные микрофоны) этого мало.
Как работает: Нейросеть строит эталоны голосов и точнее распознаёт, кто именно говорит. Чувствительность настраивается (Строгая / Сбалансированная / Мягкая). Требуется бесплатный токен HuggingFace. Опция для продвинутых пользователей; по умолчанию выключена и используется быстрый энергетический алгоритм.

6. Обработка звука

Фильтр шумов

Обрезает частоты ниже 80Гц (гул) и выше 6000Гц. Помогает алгоритму лучше слышать голос.

Выравнивание громкости

Выравнивает громкость спикеров перед анализом (полезно, если один говорит тихо, а другой громко).

7. Настройки экспорта

Экспорт

Финальные параметры перед созданием XML-файла.

Разрешение секвенции

Выберите размер кадра для итогового видео.

Автоматическая подгонка:
Если ваши исходники сняты в 4K, а вы выберете FullHD (1080p) — программа автоматически уменьшит видео под размер проекта без потери важных деталей.

Совет: Для YouTube и соцсетей стандарта FullHD (1920x1080) обычно достаточно.

Формат XML

Выберите программу, в которой будете продолжать монтаж:

Adobe Premiere Pro:
Создается классический XML файл. Полная поддержка цветов клипов.

DaVinci Resolve:
Создается адаптированный файл (FCP7 XML v2), который корректно читается в DaVinci.

Мультикамера (только DaVinci Resolve):
Можно выгрузить проект как нативный Multicam-клип: все ракурсы собраны и синхронизированы на одной дорожке — переключать камеры можно одним кликом прямо в режиме воспроизведения.

Внимание пользователям Windows

DaVinci Resolve на Windows может зависнуть при импорте, если разные исходники имеют одинаковые имена (например, файл C0001.MP4 есть и у Спикера, и на Общем плане).

Решение: Перед загрузкой в программу убедитесь, что все видеофайлы имеют уникальные названия.

Упаковка

Искусственный интеллект анализирует ваше видео и готовит всё для публикации на YouTube: цепляющие заголовки, описание, теги, таймкоды и промо-материалы.

Как это работает

Загрузите готовое видео или аудио — программа «прослушает» его и сгенерирует полный SEO-пакет для YouTube. Не нужно вручную придумывать заголовки и расставлять таймкоды.

Для работы «Упаковки» нужна локальная транскрипция Whisper (включена по умолчанию). Без неё анализ невозможен — подробнее в разделе «Настройки».

  1. Выберите файл Видео / Аудио.
  2. Выберите модель AI и нажмите «Сгенерировать».

Что вы получите

Названия

Несколько вариантов цепляющих заголовков под клик.

Описание

Готовое SEO-описание для поля под видео.

Теги

Набор релевантных ключевых слов для продвижения.

Таймкоды

Главы с временными метками. Точность зависит от модели Whisper (см. раздел «Настройки»).

Промо-пакет

Дополнительные материалы для продвижения ролика в один клик:

  • Закреплённый комментарий — текст, который стоит закрепить под видео.
  • Пост в Telegram — готовый анонс для вашего канала.
  • Пост в «Сообщество» — для вкладки Community на YouTube.
  • Идеи для Shorts — подсказки, какие моменты вырезать в короткие вертикальные ролики.
Рекомендации

Отдельная вкладка с аналитикой ролика: оценка виральности, удержания внимания и советы по монтажу — на что обратить внимание в следующий раз.

Нужна транскрипция Whisper

«Упаковка» работает только с включённой локальной транскрипцией Whisper — программа анализирует именно текст вашей речи. Whisper включён по умолчанию и устанавливается автоматически; управлять им можно в разделе «Настройки». Чем точнее модель, тем точнее таймкоды (вплоть до ±5 сек).

Обложки

Генерация ярких превью для YouTube с помощью нейросети. Опишите идею — и получите готовую обложку с вашим лицом.

Как создать обложку
  1. Введите заголовок, который будет на обложке.
    Кнопка «Идеи заголовков» предложит варианты на основе анализа вашего видео из вкладки «Упаковка».
  2. Опишите фон: атмосферу, эмоции, цвета, объекты.
  3. Добавьте лицо спикера — загрузите фото или возьмите кадр прямо из видео.
  4. Выберите соотношение сторон и качество, нажмите «Сгенерировать».

Каждая генерация обложки расходует токены. Стоимость зависит от выбранной модели и качества (1K / 2K / 4K) — точное число видно прямо на кнопке перед запуском.

Лица спикеров

Загрузите фото или выберите случайный кадр из видео — нейросеть вставит лицо в обложку.

Референс стиля

Загрузите понравившуюся чужую обложку как образец — программа повторит её стиль.

Качество и формат

Соотношение сторон (16:9 для YouTube, 9:16 для Shorts) и до 4K качества.

Галерея и версии

Все варианты сохраняются в галерею. Кнопка «поправить» дорабатывает обложку, не теряя предыдущие версии.

Настройки: точность и транскрипция

Распознавание речи (Whisper) — основа для «Упаковки» и точных таймкодов. Оно же помогает и «Обложкам»: кнопка «Идеи заголовков» опирается на расшифровку вашего видео.

Точные таймкоды (Whisper)

Локальная транскрипция аудио прямо на вашем компьютере (офлайн, без отправки в облако). Включена по умолчанию и обязательна для «Упаковки» — без неё анализ подкаста невозможен. Резко повышает точность таймкодов в главах — до ±5 секунд вместо нескольких минут.

Модели на выбор

TinyТочность ~85%, самый быстрый, минимальный размер. Таймкоды ±30 сек.
BaseТочность ~90%, лёгкий и быстрый.
SmallТочность ~94%, баланс размера и качества. Таймкоды ±10 сек.
Turbo (large-v3-turbo) ★ рекомендуемТочность ~98.5%. Скачивается ~800 МБ при первом запуске.
Large-v3Максимальная точность ~99%, таймкоды ±2 сек. ~1.5 ГБ, медленнее Turbo на ~30%.

Зависимости (mlx-whisper для Apple Silicon или faster-whisper для Intel/Windows) устанавливаются автоматически. Модель скачивается один раз и кешируется на устройстве — в этом же разделе можно управлять кэшем и удалять ненужные модели.

AI Распознавание спикеров

Расширенный режим для вкладки «Монтаж»: нейросеть отличает спикеров по голосу. Для работы требуется бесплатный токен HuggingFace — инструкция по подключению есть прямо в приложении.

Обложки

Здесь задаются параметры генерации превью для вкладки «Обложки»:

Модель Nano Banana 2 — быстрая и экономичная модель. Подходит для большинства задач. ~140 токенов.

Nano Banana Pro — более мощная модель с улучшенной детализацией и точностью передачи лица. Рекомендуется для финальных обложек. ~280 токенов.

Список и стоимость подгружаются с сервера и могут обновляться.
Качество 1K — базовое, множитель ×1. Подходит для черновиков.
2K (×1.5) — оптимально для YouTube.
4K (×2) — максимальная детализация.
Итоговая стоимость = цена модели × множитель качества.

Остались вопросы?

Если возникли сложности с настройкой или вы нашли ошибку, напишите нам напрямую в поддержку.

Написать в @chikchiksupport

User Manual

Everything you need to know about setting up and working with Chik-Chik.

1. System Requirements

Operating System Windows 10/11 (x64)
macOS 11.0+ (Big Sur and newer)
Processor (CPU) Any multi-core processor (Intel Core i3 / AMD Ryzen 3 or higher).
Apple Silicon (M1/M2/M3/M4/M5) support — native.
RAM Minimum: 8 GB (required for Whisper transcription)
Recommended: 16 GB (for long videos 1h+ and heavy models)
Graphics (GPU) Not required (integrated graphics is sufficient)
Free Space ~300 MB for the app + up to ~1.5 GB for a Whisper model (downloaded once) + space for your video files

Tip: For maximum performance, we recommend storing source video files on an SSD drive.

2. Installation and Launch

  1. Download ChikChik_Setup.exe from the main page.
  2. Run the installer. Windows may show a SmartScreen warning — click "More info" -> "Run anyway".
  3. After installation, a Chik-Chik icon will appear on your desktop. Launch it.
  1. Download the macOS archive.
  2. Extract the archive (double-click the .zip file).
  3. Launch the ChikChik application.
  4. Important on first launch:
    If macOS blocks the launch ("Cannot verify developer"):
    • Open System Settings -> Privacy & Security.
    • Scroll down to the "Security" section.
    • Click "Open Anyway" button.
  5. On first edit: The system may request file access. Be sure to click "Allow".

3. Authorization

We use Telegram login. Payment and subscription management happen inside the bot.

01

QR Code

A QR code will appear on screen. Point your phone camera at it or click the "Login via Telegram" button.

02

Bot @ChikChikAuthBot

The bot will open. Click "Start" to activate.
Subscription payment and slot purchases happen right in the bot dialog.

03

Done

The program will automatically launch if you have a subscription or an active trial period (3 days).

Subscription Terms

  • Trial period: First 3 days free. If you plan to continue using the program, you need to pay for a subscription in the bot.
  • Device limit: One subscription = 1 device.
  • Additional slots: Want to work on both PC and laptop? You can purchase additional device slots in the bot menu.
  • Tokens: The app's AI features — SEO generation in "Packaging", title ideas and thumbnail generation — spend tokens from your balance. The cost of each action is shown right in the interface before you run it. Local Whisper transcription works offline and spends no tokens. You can top up your balance in the Telegram bot or on the website.

Editing

Load your camera and microphone recordings — the program edits the video by sound, switching angles like a live director.

4. Project Settings

Overview of the main program features.

Wide Shot
Multiple files

Enable this toggle if the wide shot recording is split into multiple files (e.g., 001.MP4, 002.MP4).

Speakers

Add 1 to 7 speakers. For each one, specify:

  • Name: Track name in your editing software.
  • Color: Track color on the timeline (Premiere Pro).
  • Video: Slot for video files.
    You can load one file or multiple (if recording was stopped or multicam is used).
    To load multiple files, enable the "Multiple files" toggle under the slot.
  • Audio: Slot for a separate audio track (optional).
    If the slot is empty, the program will use audio from the video file.
  • Audio channel (L / R / Mono): NEW
    Below the "Audio" slot there are two dropdowns:
    Video source — which file to take the sound from: "Own video", "Wide Shot" or another speaker's video.
    Channel — which channel to use: Mono (the whole signal), Left (L) or Right (R).

    This is useful when a speaker's sound is recorded into the L or R channel of another speaker's video file. Pick the right file in "Source" and select the channel — the program will extract exactly that signal.
Leading

Priority in conflicts and the right to interrupt the wide shot.

Single speaker mode

Filming yourself on several cameras (blog, expert content)? Add just one speaker — and the program will produce a multicam edit from a single "talker", automatically switching angles and breaking the picture up with the wide shot.

In this mode the program automatically hides the irrelevant settings (interruptions, switch delay, pause between wide shots) — they're only needed for multi-participant dialogues. The interface stays clean.

5. Editing Algorithms

Settings for the "personality" of your automatic director.

Speaker shot time

10 – 13 sec
Why: So the viewer doesn't get bored looking at one "talking head".
How it works: Defined as a range (e.g., 10–13 sec). On every switch the program picks a random value within this interval — the edit feels "alive" and unpredictable. When a speaker talks continuously longer than the chosen value, the camera cuts to the wide shot.

Wide shot time

8 – 12 sec
Why: Protection from the "strobe" effect (flickering) and to let the viewer take in the scene.
How it works: Also defined as a range — the left handle is the minimum hold time for the wide shot, the right one is the maximum. The actual duration is chosen at random. Even if someone starts talking, the camera won't snap back instantly.

Camera rotation

10 – 20 sec
Condition: Appears only if the speaker has several angles loaded ("Multiple files" mode enabled — multicam or a recording break).
How it works: You set a range (e.g., 10 to 20 sec). The program switches angles at a random moment within this interval, so the edit looks natural and not monotonous.

Interruption threshold

5 sec
Leading priority. Appears only if one of the speakers is assigned the "Leading" role.
Usually the program holds the wide shot for the set time. But the Leading speaker has the right to "grab" the camera earlier.
The lower the value — the more aggressively the Leading captures the air.

Voice separation threshold

8 dB
Recommendation: Leave at 8 dB (optimal for 90% of cases).
How it works: This protects against false triggers. The program will switch the camera only if the new speaker is louder than the current one by this value.
When to decrease (3-5 dB): If the program "lags" and can't keep up with fast dialogues (studio sound).
When to increase (12-15 dB): If the program jumps chaotically due to echo or a neighbor's sighs.

Pause between wide shots NEW

30 sec
Why: So the wide shot doesn't appear too often and become tiresome.
How it works: After each wide shot the program waits the set time before showing it again. The higher the value — the less often the viewer sees the "far" angle.

Switch delay NEW

0.30 – 0.60 sec
"Editing naturalness" block
Why: A live director doesn't react instantly — they switch the camera with a slight delay.
How it works: When a new speaker starts talking, the program doesn't cut exactly at that millisecond, but waits a random moment within the range (0.30–0.60 sec by default). 0 sec — instant reaction. The edit stops feeling "robotic".

Reaction shots NEW

Enable reactions
Why: To keep the edit alive, you sometimes want to show not the speaker, but the person who's listening and reacting (nodding, smiling).
How it works: While one speaker talks for a long time, the program occasionally inserts a short "cutaway" to the listener's face. Configurable:
Probability — how often to insert a reaction (0–100%).
Reaction length — duration range (1.5–2.5 sec).
Min interval — pause between reactions (60–300 sec).
Not before (sec of speech) — a reaction is not inserted until the speaker has talked for at least this time.
Available only with 2+ speakers.

AI Speaker Recognition NEW

AI speaker detection
Why: The regular algorithm decides who's speaking by loudness. In tricky conditions (echo, cross-talking mics) that's not enough.
How it works: A neural network builds voice references and more accurately recognizes who exactly is speaking. Sensitivity is configurable (Strict / Balanced / Soft). A free HuggingFace token is required. An option for advanced users; off by default, with the fast energy-based algorithm used instead.

6. Audio Processing

Noise Filter

Cuts frequencies below 80Hz (hum) and above 6000Hz. Helps the algorithm hear the voice better.

Volume Leveling

Levels speaker volumes before analysis (useful if one speaks quietly and another loudly).

7. Export Settings

Export

Final parameters before creating the XML file.

Sequence Resolution

Choose the frame size for the final video.

Automatic scaling:
If your source is shot in 4K, and you select FullHD (1080p) — the program will automatically downscale the video to project size without losing important details.

Tip: For YouTube and social media, FullHD (1920x1080) is usually sufficient.

XML Format

Choose the program where you'll continue editing:

Adobe Premiere Pro:
Creates a classic XML file. Full clip color support.

DaVinci Resolve:
Creates an adapted file (FCP7 XML v2) that reads correctly in DaVinci.

Multicam (DaVinci Resolve only):
You can export the project as a native Multicam clip: all angles are collected and synced on a single track — you can switch cameras with a single click right in playback mode.

Attention Windows users

DaVinci Resolve on Windows may freeze during import if different sources have identical names (e.g., file C0001.MP4 exists for both Speaker and Wide Shot).

Solution: Before loading into the program, make sure all video files have unique names.

Packaging

The AI analyzes your video and prepares everything for publishing on YouTube: catchy titles, a description, tags, timecodes and promo materials.

How it works

Load a finished video or audio — the program "listens" to it and generates a full SEO package for YouTube. No need to come up with titles and place timecodes manually.

"Packaging" requires local Whisper transcription (enabled by default). Without it analysis is impossible — see the "Settings" section.

  1. Choose a Video / Audio file.
  2. Pick an AI model and click "Generate".

What you get

Titles

Several variants of catchy, click-worthy titles.

Description

A ready-made SEO description for the field under the video.

Tags

A set of relevant keywords for promotion.

Timecodes

Chapters with time markers. Accuracy depends on the Whisper model (see the "Settings" section).

Promo pack

Extra materials to promote the video in one click:

  • Pinned comment — text worth pinning under the video.
  • Telegram post — a ready announcement for your channel.
  • Community post — for the Community tab on YouTube.
  • Shorts ideas — hints on which moments to cut into short vertical clips.
Recommendations

A separate tab with video analytics: a virality estimate, attention retention and editing tips — what to pay attention to next time.

Whisper transcription required

"Packaging" only works with local Whisper transcription enabled — the program analyzes the actual text of your speech. Whisper is on by default and installs automatically; you can manage it in the "Settings" section. The more accurate the model, the more accurate the timecodes (down to ±5 sec).

Thumbnails

Generate bright previews for YouTube with a neural network. Describe your idea — and get a ready thumbnail with your face.

How to create a thumbnail
  1. Enter the title that will be on the thumbnail.
    The "Title ideas" button suggests variants based on the analysis of your video from the "Packaging" tab.
  2. Describe the background: mood, emotions, colors, objects.
  3. Add the speaker's face — upload a photo or grab a frame straight from the video.
  4. Choose the aspect ratio and quality, then click "Generate".

Each thumbnail generation spends tokens. The cost depends on the chosen model and quality (1K / 2K / 4K) — the exact number is shown right on the button before you run it.

Speaker faces

Upload a photo or pick a random frame from the video — the neural network inserts the face into the thumbnail.

Style reference

Upload someone else's thumbnail you like as a sample — the program will replicate its style.

Quality and format

Aspect ratio (16:9 for YouTube, 9:16 for Shorts) and up to 4K quality.

Gallery and versions

All variants are saved to the gallery. The "refine" button improves the thumbnail without losing previous versions.

Settings: accuracy and transcription

Speech recognition (Whisper) is the foundation for "Packaging" and accurate timecodes. It also helps "Thumbnails": the "Title ideas" button relies on your video's transcript.

Accurate timecodes (Whisper)

Local audio transcription right on your computer (offline, nothing sent to the cloud). Enabled by default and required for "Packaging" — without it, podcast analysis is impossible. Dramatically improves chapter timecode accuracy — down to ±5 seconds instead of several minutes.

Models to choose from

Tiny~85% accuracy, fastest, minimal size. Timecodes ±30 sec.
Base~90% accuracy, light and fast.
Small~94% accuracy, a balance of size and quality. Timecodes ±10 sec.
Turbo (large-v3-turbo) ★ recommended~98.5% accuracy. Downloads ~800 MB on first run.
Large-v3Maximum accuracy ~99%, timecodes ±2 sec. ~1.5 GB, ~30% slower than Turbo.

Dependencies (mlx-whisper for Apple Silicon or faster-whisper for Intel/Windows) install automatically. The model is downloaded once and cached on your device — in this same section you can manage the cache and delete unneeded models.

AI Speaker Recognition

Advanced mode for the "Editing" tab: a neural network tells speakers apart by voice. A free HuggingFace token is required — connection instructions are right inside the app.

Thumbnails

Here you set the preview generation parameters for the "Thumbnails" tab:

Model Nano Banana 2 — a fast and economical model. Suitable for most tasks. ~140 tokens.

Nano Banana Pro — a more powerful model with improved detail and face accuracy. Recommended for final thumbnails. ~280 tokens.

The list and pricing are loaded from the server and may change.
Quality 1K — basic, multiplier ×1. Good for drafts.
2K (×1.5) — optimal for YouTube.
4K (×2) — maximum detail.
Final cost = model price × quality multiplier.

Still have questions?

If you have trouble with setup or found a bug, write to us directly in support.

Contact @chikchiksupport