Перейти к содержимому

M-Forge

M-Forge - единый медиахаб по адресу /m-forge: одно место для любого медиа, которое вы создаёте в MAVEN. Его вкладки верхнего уровня - AI-Vision, Compose, Remove Watermark, Studio (Story / Cut / Dub), OpenMontage, Music, Thumbnails и браузерная Media Content Lab. OpenMontage, Music и Thumbnails раньше были отдельными приложениями, а теперь стали вкладками здесь.

M-Forge - M.A.V.E.N

Дайте модели посмотреть видео. Вставьте URL (YouTube/Loom/TikTok/… через yt-dlp) или локальный файл, выберите Задачу (Summarize, Transcribe, Key moments, Hook analysis, Notes, Diagnose bug или свободная формулировка) и Язык - и модель ответит, опираясь на реальные кадры плюс транскрипт.

  • Выполняется как фоновая задача - продолжает работать, если вы переключились на другое приложение (при возврате виден бейдж Running).
  • Переиспользует обработанное видео для уточняющих вопросов (без повторного просмотра).
  • Дублирует каждый ответ в ваше хранилище (vault) Obsidian в ~/Obsidian/maven-os/vision/.
  • Выпадающий список Model показывает vision-модели, доступные по вашим ключам: Claude читает кадры нативно; Gemini / GPT-4o / Kimi / OpenRouter получают кадры как изображения.
  • Язык ответа гарантируется моделью, поэтому даже английские субтитры возвращаются на выбранном вами языке.
  • разворачивает на весь экран; + New session начинает новое видео, сохраняя вашу историю.

Работает на Windows, macOS и Linux. Для загрузки видео с YouTube нужна среда выполнения JavaScript, и M.A.V.E.N передаёт загрузчику тот Node, на котором сам уже работает, вместо того чтобы просить вас его установить.

Заказывает анимированные HTML-видеокомпозиции через запуск Claude Code, с предпросмотром и списком проектов (бывшее отдельное приложение Video). Требует CLI claude.

Удаление или добавление водяных знаков и логотипов на изображениях и видео. Переключатель Pipeline выбирает между:

  • Local · on-device - ваш собственный ~/wm-engine (GPU). Изображение = инпейнтинг LaMa по нарисованной маске; видео обрезается вокруг вашего прямоугольника и предлагает Smooth · LaMa (быстро, меньше мерцания; по умолчанию), ProPainter (на основе оптического потока, практически нулевое мерцание - лучший результат, но медленно, ~30-40 с на секунду видео) и Sharp · LaMa (покадрово). Полностью офлайн, без токена, без лимитов; бейдж статуса показывает GPU. Нужна однократная установка движка.
  • Cloud · HF Space - проксирует в smmisha/watermark-remover (Gemini/LaMa/OpenCV) через его REST API, держа HF_TOKEN на стороне сервера.

Три вкладки:

  • Image - нарисуйте маску кистью или используйте инструмент прямоугольника. Результаты сохраняются в wm-removal/.
  • Video - растяните прямоугольник; на долгих задачах - живой счётчик кадров и прогресс-бар. Результаты сохраняются в wm-removal/.
  • Add logo / text - перетащите изображение/видео, нарисуйте прямоугольник, который можно двигать и масштабировать, добавьте PNG-логотип или текст/заметку с цветом и прозрачностью → вжигается через ffmpeg. Результаты сохраняются в overlays/.

Везде у исходного кадра есть зум - кнопки плюс колесо мыши (до 16×; прокрутка для панорамирования) - для точного выделения. (Результаты удаления также попадают в mwm-removal/.) Все результаты сохраняются в ваше хранилище Obsidian.

Два - теперь уже три - продакшн-пайплайна, выбираемые карточкой режима (как разделение курс/презентация в P-Forge). Все они - порты платных навыков Claude на бесплатные движки MAVEN.

Написанная история становится последовательностью иллюстраций, сохраняющих одних и тех же персонажей, локации и стиль от сцены к сцене. Пайплайн пишет визуальную «библию», рисует по одной референс-табличке на персонажа/локацию, а затем рисует каждую сцену с приложенными табличками, чтобы рыжеволосая девочка оставалась той же девочкой на всём протяжении. Бесплатно на Gemini через прокси Antigravity. Попадает в ~/Obsidian/maven-os/story/<slug>/.

Сырая запись говорящей головы становится чистым монтажом. Пайплайн транскрибирует с пословными таймингами (автоматически выбирает бесплатный Whisper-тариф Groq, если задан GROQ_API_KEY, иначе полностью локальный faster-whisper), выбранная вами модель решает, какие фрагменты вырезать (слова-паразиты, фальстарты, паузы - по умолчанию консервативно), длинные паузы обрезаются детерминированно, а ffmpeg рендерит один бесшовный мастер. Модель никогда не трогает ffmpeg - она лишь принимает редакторское решение по тексту. Мастера попадают в ~/Obsidian/maven-os/studio-cut/.

Озвучка на другом языке. Дайте локальный файл, загрузку или YouTube/URL (скачивается через yt-dlp). Пайплайн транскрибирует с таймингами, переводит каждую строку выбранной вами моделью, озвучивает её и укладывает каждый клип обратно на исходную временную шкалу. Сначала запустите 10-секундный превью, чтобы подобрать настройки, затем полный дубляж.

  • Два TTS-движка - бесплатный Supertonic (31 язык, офлайн, голоса F1-M5) или ElevenLabs с выбором модели (v3 / multilingual v2 / turbo / flash / v1) и собственным списком голосов.
  • Тонкая настройка - темп, тембр (высота тона), уровень музыки, плюс stability / similarity / style для ElevenLabs.
  • Сохранить оригинальную музыку - подмешивает новый голос под исходную музыку; включается, как только установлен demucs.
  • Результат - воспроизводится прямо во вкладке и скачивается как .m4a или .mp3; из видео на входе получается дублированный .mp4 на выходе. Попадает в ~/Obsidian/maven-os/studio-dub/.

DUB - фоновая задача с кнопкой New session: уйдите в другое приложение и вернитесь - работа продолжается.

Все три пайплайна Studio по умолчанию работают на бесплатных движках; опция ElevenLabs в DUB - единственный платный путь, и ей нужен ELEVENLABS_API_KEY в .env.local.

AI-«фильмы» - длительный запуск Claude Code собирает композицию в вашем репозитории OpenMontage, отслеживаемую по pid плюс выходному файлу (бывшее отдельное приложение OpenMontage). Change folder указывает на ваш репозиторий, если вы клонировали его в другое место. Во время запуска агент может поднять живую раскадровку Backlot на http://127.0.0.1:4750; Stop Backlot её останавливает (отмена рендера останавливает только агента Claude, но не Backlot). Нужны CLI claude (с выполненным входом) и ffmpeg в PATH; путь к репозиторию по умолчанию - ~/OpenMontage (переопределяется через OPENMONTAGE_DIR). Режим фильма использует fal.ai (Veo / Kling / MiniMax / Seedance) - задайте FAL_KEY. Рендеры попадают в ~/.maven/openmontage/<id>.mp4 и появляются в Медиатеке.

Музыкальная студия Suno (бывшее отдельное приложение Music). Выберите модель, введите промпт (при желании - инструментал) и генерируйте; готовые треки и обложки попадают на диск, а остаток кредитов Suno показывается во вкладке. Нужен SUNO_API_KEY в .env.localsunoapi.org). Результат сохраняется в ~/.maven/music и появляется в Медиатеке.

Social Networks Posts Covers - генерирует обложки и посты для соцсетей моделями изображений fal.ai (бывшее отдельное приложение Thumbnails). Опишите обложку (или попросите редизайн), выберите Model (FLUX.1 schnell / dev, FLUX1.1 pro / ultra, Recraft V3, Ideogram V3 - у каждой показана ≈ цена за изображение), Format / size (универсальные пропорции плюс пресеты YouTube, Instagram, TikTok, X/Twitter, Facebook, LinkedIn, Pinterest и OG) и количество. Нужен FAL_KEY (принимается и как FAL_API_KEY); KIE_API_KEY по желанию добавляет kie.ai как второго провайдера. Результат сохраняется в хранилище в папку Thumbnails/ и появляется в Медиатеке.

Лаборатория ffmpeg.wasm в браузере: ~29 быстрых медиаопераций, которые выполняются целиком в вашем браузере - ничего не выгружается, ничего не покидает вашу машину. Семейства операций охватывают GIF maker, compress, format-convert, resize, extract / mix / mute audio, trim, speed и другие. Поскольку всё полностью на стороне клиента, не нужны ни ключ, ни движок, ни сеть.

  • Пикер Медиатеки в каждом поле файла - вместо поиска по диску подтягивайте медиа, уже сгенерированные в M.A.V.E.N (S-Forge, OpenMontage, Music, Thumbnails, Studio, …), прямо из вашей Медиатеки.
  • Автосохранение в хранилище - результат лаборатории автоматически сохраняется в ваше хранилище Obsidian, так что он появляется рядом со всем остальным, что вы создали.
  • yt-dlp - для URL-источников в AI-Vision и Studio → Cut / Dub (YouTube/Loom/TikTok/…). Источникам из локальных файлов/загрузок нужен только ffmpeg. Установите отдельный бинарник в ~/.local/bin (или brew install yt-dlp). yt-dlp также разворачивается скриптом scripts/setup-free-engines.sh.
  • ffmpeg - нужен для вжигания водяных знаков, Cut и Dub.
  • Compose - CLI claude с выполненным входом.
  • Remove Watermark · Local - однократная установка ~/wm-engine: bash scripts/wm-engine/setup.sh, затем bash scripts/install-autostart.sh --now (регистрирует wm-engine.service на :8189). Нужны python3.11 (у PyTorch нет wheel-пакетов для 3.14), ffmpeg и ~6 ГБ на диске; GPU NVIDIA необязателен, но рекомендуется (иначе - откат на CPU). Цель переопределяется через WM_ENGINE_URL, устройство - через WM_DEVICE=cpu|cuda.
  • Remove Watermark · Cloud - устанавливать нечего; задайте HF_TOKEN (хранится на стороне сервера).
  • Studio · транскрипция Cut / Dub - GROQ_API_KEY выбирает бесплатный Whisper-тариф Groq; без него используется локальный faster-whisper в venv Studio (~/.maven/studio/venv), без ключа. (Groq здесь обслуживает Whisper - это не Grok от xAI.)
  • Studio · Dub - бесплатный Supertonic (~/.maven/supertonic/venv, разворачивается скриптом scripts/setup-free-engines.sh) - TTS по умолчанию; ElevenLabs (ELEVENLABS_API_KEY) - платная альтернатива. Для сохранения оригинальной музыки нужен demucs в venv Studio (~/.maven/studio/venv/bin/pip install demucs, тянет torch, ~2 ГБ).
  • Studio · Story - бесплатно на Gemini через прокси Antigravity.
  • AI-Vision сохраняет обработанное видео, поэтому задавайте уточняющие вопросы, не платя за повторный просмотр.
  • Для удаления водяных знаков с видео без мерцания используйте ProPainter, но рассчитывайте на ~30-40 с на секунду материала; когда важна скорость - Smooth · LaMa.
  • В DUB всегда запускайте 10-секундный превью перед полным дубляжом, чтобы подобрать темп, тембр и уровень музыки.
  • S-Forge - AI-кинорежиссёр; его пайплайны Studio - тоже портированные платные навыки.
  • P-Forge - использует тот же бесплатный голосовой стек Supertonic/ElevenLabs.
  • Local-first