Всё, что нужно знать о настройке и работе с Чик-Чик.
| Операционная система |
Windows 10/11 (x64) macOS 11.0+ (Big Sur и новее) |
|---|---|
| Процессор (CPU) |
Любой многоядерный процессор (Intel Core i3 / AMD Ryzen 3 и выше). Поддержка Apple Silicon (M1/M2/M3/M4/M5) — нативная. |
| Оперативная память (RAM) |
Минимум: 8 ГБ (нужно для транскрипции Whisper) Рекомендуется: 16 ГБ (для длинных видео 1ч+ и тяжёлых моделей) |
| Видеокарта (GPU) | Не требуется (достаточно встроенной графики) |
| Интернет |
Требуется для AI-функций (Упаковка, Обложки) и авторизации. Монтаж и локальная транскрипция Whisper работают полностью офлайн. |
| Свободное место | ~300 МБ на программу + модель Whisper (скачивается один раз): рекомендуемая ~800 МБ, максимальная ~1.5 ГБ + место для ваших видеофайлов |
Совет: Для максимальной скорости работы рекомендуем хранить исходные видеофайлы на SSD диске.
Мы используем вход через Telegram. Оплата и управление подпиской происходят внутри бота.
На экране появится QR-код. Наведите на него камеру телефона или нажмите кнопку "Войти через Telegram".
Откроется бот. Нажмите "Старт" для активации.
Оплата подписки и покупка слотов происходит прямо в диалоге с ботом.
Программа автоматически запустится, если у вас есть подписка или активен пробный период (3 дня).
Загрузите записи с камер и микрофонов — программа сама смонтирует видео по звуку, переключая ракурсы, как живой режиссёр.
Разбор основных функций программы.
Включите этот тумблер, если запись с общей камеры разбита на несколько файлов (например, 001.MP4, 002.MP4).
Добавьте от 1 до 7 спикеров. Для каждого укажите:
Приоритет в спорах и право перебивать общий план.
Снимаете себя на несколько камер (блог, экспертный контент)? Добавьте всего одного спикера — и программа смонтирует мультикам-видео с одного «говорящего», автоматически переключая ракурсы и разбавляя картинку общим планом.
В этом режиме программа сама отключает лишние настройки (перебивки, задержку переключения, паузу между общими планами) — они нужны только для диалогов нескольких участников. Интерфейс остаётся чистым.
Настройки "характера" вашего автоматического режиссера.
Обрезает частоты ниже 80Гц (гул) и выше 6000Гц. Помогает алгоритму лучше слышать голос.
Выравнивает громкость спикеров перед анализом (полезно, если один говорит тихо, а другой громко).
Финальные параметры перед созданием XML-файла.
Выберите размер кадра для итогового видео.
Автоматическая подгонка:
Если ваши исходники сняты в 4K, а вы выберете FullHD (1080p) — программа автоматически уменьшит видео под размер проекта без потери важных деталей.
Совет: Для YouTube и соцсетей стандарта FullHD (1920x1080) обычно достаточно.
Выберите программу, в которой будете продолжать монтаж:
Adobe Premiere Pro:
Создается классический XML файл. Полная поддержка цветов клипов.
DaVinci Resolve:
Создается адаптированный файл (FCP7 XML v2), который корректно читается в DaVinci.
Мультикамера (только DaVinci Resolve):
Можно выгрузить проект как нативный Multicam-клип: все ракурсы собраны и синхронизированы на одной дорожке — переключать камеры можно одним кликом прямо в режиме воспроизведения.
DaVinci Resolve на Windows может зависнуть при импорте, если разные исходники имеют одинаковые имена (например, файл C0001.MP4 есть и у Спикера, и на Общем плане).
Решение: Перед загрузкой в программу убедитесь, что все видеофайлы имеют уникальные названия.
Искусственный интеллект анализирует ваше видео и готовит всё для публикации на YouTube: цепляющие заголовки, описание, теги, таймкоды и промо-материалы.
Загрузите готовое видео или аудио — программа «прослушает» его и сгенерирует полный SEO-пакет для YouTube. Не нужно вручную придумывать заголовки и расставлять таймкоды.
Для работы «Упаковки» нужна локальная транскрипция Whisper (включена по умолчанию). Без неё анализ невозможен — подробнее в разделе «Настройки».
Несколько вариантов цепляющих заголовков под клик.
Готовое SEO-описание для поля под видео.
Набор релевантных ключевых слов для продвижения.
Главы с временными метками. Точность зависит от модели Whisper (см. раздел «Настройки»).
Дополнительные материалы для продвижения ролика в один клик:
Отдельная вкладка с аналитикой ролика: оценка виральности, удержания внимания и советы по монтажу — на что обратить внимание в следующий раз.
«Упаковка» работает только с включённой локальной транскрипцией Whisper — программа анализирует именно текст вашей речи. Whisper включён по умолчанию и устанавливается автоматически; управлять им можно в разделе «Настройки». Чем точнее модель, тем точнее таймкоды (вплоть до ±5 сек).
Генерация ярких превью для YouTube с помощью нейросети. Опишите идею — и получите готовую обложку с вашим лицом.
Каждая генерация обложки расходует токены. Стоимость зависит от выбранной модели и качества (1K / 2K / 4K) — точное число видно прямо на кнопке перед запуском.
Загрузите фото или выберите случайный кадр из видео — нейросеть вставит лицо в обложку.
Загрузите понравившуюся чужую обложку как образец — программа повторит её стиль.
Соотношение сторон (16:9 для YouTube, 9:16 для Shorts) и до 4K качества.
Все варианты сохраняются в галерею. Кнопка «поправить» дорабатывает обложку, не теряя предыдущие версии.
Распознавание речи (Whisper) — основа для «Упаковки» и точных таймкодов. Оно же помогает и «Обложкам»: кнопка «Идеи заголовков» опирается на расшифровку вашего видео.
Локальная транскрипция аудио прямо на вашем компьютере (офлайн, без отправки в облако). Включена по умолчанию и обязательна для «Упаковки» — без неё анализ подкаста невозможен. Резко повышает точность таймкодов в главах — до ±5 секунд вместо нескольких минут.
| Tiny | Точность ~85%, самый быстрый, минимальный размер. Таймкоды ±30 сек. |
|---|---|
| Base | Точность ~90%, лёгкий и быстрый. |
| Small | Точность ~94%, баланс размера и качества. Таймкоды ±10 сек. |
| Turbo (large-v3-turbo) ★ рекомендуем | Точность ~98.5%. Скачивается ~800 МБ при первом запуске. |
| Large-v3 | Максимальная точность ~99%, таймкоды ±2 сек. ~1.5 ГБ, медленнее Turbo на ~30%. |
Зависимости (mlx-whisper для Apple Silicon или faster-whisper для Intel/Windows) устанавливаются автоматически. Модель скачивается один раз и кешируется на устройстве — в этом же разделе можно управлять кэшем и удалять ненужные модели.
Расширенный режим для вкладки «Монтаж»: нейросеть отличает спикеров по голосу. Для работы требуется бесплатный токен HuggingFace — инструкция по подключению есть прямо в приложении.
Здесь задаются параметры генерации превью для вкладки «Обложки»:
| Модель |
Nano Banana 2 — быстрая и экономичная модель. Подходит для большинства задач. ~140 токенов. Nano Banana Pro — более мощная модель с улучшенной детализацией и точностью передачи лица. Рекомендуется для финальных обложек. ~280 токенов. Список и стоимость подгружаются с сервера и могут обновляться. |
|---|---|
| Качество |
1K — базовое, множитель ×1. Подходит для черновиков. 2K (×1.5) — оптимально для YouTube. 4K (×2) — максимальная детализация. Итоговая стоимость = цена модели × множитель качества. |
Если возникли сложности с настройкой или вы нашли ошибку, напишите нам напрямую в поддержку.
Написать в @chikchiksupportEverything you need to know about setting up and working with Chik-Chik.
| Operating System |
Windows 10/11 (x64) macOS 11.0+ (Big Sur and newer) |
|---|---|
| Processor (CPU) |
Any multi-core processor (Intel Core i3 / AMD Ryzen 3 or higher). Apple Silicon (M1/M2/M3/M4/M5) support — native. |
| RAM |
Minimum: 8 GB (required for Whisper transcription) Recommended: 16 GB (for long videos 1h+ and heavy models) |
| Graphics (GPU) | Not required (integrated graphics is sufficient) |
| Free Space | ~300 MB for the app + up to ~1.5 GB for a Whisper model (downloaded once) + space for your video files |
Tip: For maximum performance, we recommend storing source video files on an SSD drive.
We use Telegram login. Payment and subscription management happen inside the bot.
A QR code will appear on screen. Point your phone camera at it or click the "Login via Telegram" button.
The bot will open. Click "Start" to activate.
Subscription payment and slot purchases happen right in the bot dialog.
The program will automatically launch if you have a subscription or an active trial period (3 days).
Load your camera and microphone recordings — the program edits the video by sound, switching angles like a live director.
Overview of the main program features.
Enable this toggle if the wide shot recording is split into multiple files (e.g., 001.MP4, 002.MP4).
Add 1 to 7 speakers. For each one, specify:
Priority in conflicts and the right to interrupt the wide shot.
Filming yourself on several cameras (blog, expert content)? Add just one speaker — and the program will produce a multicam edit from a single "talker", automatically switching angles and breaking the picture up with the wide shot.
In this mode the program automatically hides the irrelevant settings (interruptions, switch delay, pause between wide shots) — they're only needed for multi-participant dialogues. The interface stays clean.
Settings for the "personality" of your automatic director.
Cuts frequencies below 80Hz (hum) and above 6000Hz. Helps the algorithm hear the voice better.
Levels speaker volumes before analysis (useful if one speaks quietly and another loudly).
Final parameters before creating the XML file.
Choose the frame size for the final video.
Automatic scaling:
If your source is shot in 4K, and you select FullHD (1080p) — the program will automatically downscale the video to project size without losing important details.
Tip: For YouTube and social media, FullHD (1920x1080) is usually sufficient.
Choose the program where you'll continue editing:
Adobe Premiere Pro:
Creates a classic XML file. Full clip color support.
DaVinci Resolve:
Creates an adapted file (FCP7 XML v2) that reads correctly in DaVinci.
Multicam (DaVinci Resolve only):
You can export the project as a native Multicam clip: all angles are collected and synced on a single track — you can switch cameras with a single click right in playback mode.
DaVinci Resolve on Windows may freeze during import if different sources have identical names (e.g., file C0001.MP4 exists for both Speaker and Wide Shot).
Solution: Before loading into the program, make sure all video files have unique names.
The AI analyzes your video and prepares everything for publishing on YouTube: catchy titles, a description, tags, timecodes and promo materials.
Load a finished video or audio — the program "listens" to it and generates a full SEO package for YouTube. No need to come up with titles and place timecodes manually.
"Packaging" requires local Whisper transcription (enabled by default). Without it analysis is impossible — see the "Settings" section.
Several variants of catchy, click-worthy titles.
A ready-made SEO description for the field under the video.
A set of relevant keywords for promotion.
Chapters with time markers. Accuracy depends on the Whisper model (see the "Settings" section).
Extra materials to promote the video in one click:
A separate tab with video analytics: a virality estimate, attention retention and editing tips — what to pay attention to next time.
"Packaging" only works with local Whisper transcription enabled — the program analyzes the actual text of your speech. Whisper is on by default and installs automatically; you can manage it in the "Settings" section. The more accurate the model, the more accurate the timecodes (down to ±5 sec).
Generate bright previews for YouTube with a neural network. Describe your idea — and get a ready thumbnail with your face.
Each thumbnail generation spends tokens. The cost depends on the chosen model and quality (1K / 2K / 4K) — the exact number is shown right on the button before you run it.
Upload a photo or pick a random frame from the video — the neural network inserts the face into the thumbnail.
Upload someone else's thumbnail you like as a sample — the program will replicate its style.
Aspect ratio (16:9 for YouTube, 9:16 for Shorts) and up to 4K quality.
All variants are saved to the gallery. The "refine" button improves the thumbnail without losing previous versions.
Speech recognition (Whisper) is the foundation for "Packaging" and accurate timecodes. It also helps "Thumbnails": the "Title ideas" button relies on your video's transcript.
Local audio transcription right on your computer (offline, nothing sent to the cloud). Enabled by default and required for "Packaging" — without it, podcast analysis is impossible. Dramatically improves chapter timecode accuracy — down to ±5 seconds instead of several minutes.
| Tiny | ~85% accuracy, fastest, minimal size. Timecodes ±30 sec. |
|---|---|
| Base | ~90% accuracy, light and fast. |
| Small | ~94% accuracy, a balance of size and quality. Timecodes ±10 sec. |
| Turbo (large-v3-turbo) ★ recommended | ~98.5% accuracy. Downloads ~800 MB on first run. |
| Large-v3 | Maximum accuracy ~99%, timecodes ±2 sec. ~1.5 GB, ~30% slower than Turbo. |
Dependencies (mlx-whisper for Apple Silicon or faster-whisper for Intel/Windows) install automatically. The model is downloaded once and cached on your device — in this same section you can manage the cache and delete unneeded models.
Advanced mode for the "Editing" tab: a neural network tells speakers apart by voice. A free HuggingFace token is required — connection instructions are right inside the app.
Here you set the preview generation parameters for the "Thumbnails" tab:
| Model |
Nano Banana 2 — a fast and economical model. Suitable for most tasks. ~140 tokens. Nano Banana Pro — a more powerful model with improved detail and face accuracy. Recommended for final thumbnails. ~280 tokens. The list and pricing are loaded from the server and may change. |
|---|---|
| Quality |
1K — basic, multiplier ×1. Good for drafts. 2K (×1.5) — optimal for YouTube. 4K (×2) — maximum detail. Final cost = model price × quality multiplier. |
If you have trouble with setup or found a bug, write to us directly in support.
Contact @chikchiksupport