Нейронавт | Нейросети в творчестве
IT и технологии
Канал про нейросети в компьютерной графике, в кино и вообще ТГ: https://telegram.me/GreenNeuralRobots
Мы используем cookies для работы сайта и аналитики посещаемости. Подробнее в Политике обработки данных и Правилах.
IT и технологии
Канал про нейросети в компьютерной графике, в кино и вообще ТГ: https://telegram.me/GreenNeuralRobots
Менеджер изображений с промптами от подписчика @lexxxx999 если кого интересует тема просмотра своих промптов в галерее изображений (которые вшиты в EXIF), а также создания подписей для тренировки лор. У меня обновилась утилита, которой я делюсь в исходниках. Утилита умеет хранить подписи в .txt рядом с картинками, перемещать вместе с ними в другую папку, переименовывать и удалять (вот вручную раньше напрягало постоянно следить за парами файлов), сохранять, переводить с русского (гугл-транслейт) и добавлять текст, использовать LLM для формирования подписей. https://github.com/a7in/image_caption_utility #tools
TeleStyle V2 Вторая версия стилизатора изображений и видео Конкурирует с коммерческими моделями (например, gemini‑3‑pro‑image‑preview) Выпустили TeleStyleV2-QIE2509-лоры для diffusers и diffsynth Ждем полные модели лоры QIE2511 / QIE2509, а также FLUX 2 Гитхаб HF Демо #styletransfer #stylize
Windows‑Copilot‑API Реверс-инжиниринг Microsoft Copilot Превращает чат copilot.microsoft.com в бесплатный API, совместимый с OpenAI. Даёт доступ к GPT‑4 и GPT‑5 без ключей и оплаты через локальный сервер или Python‑библиотеку. Но аккаунт Microsoft Copilot все равно нужен #coding #hack #api
Happy Horse 1.1 720p / 1080p до 15 секунд до 9 референсов fal сравнение с Seedance 2.0 #referencing #t2v #i2v
Генератор 3d-объектов на гауссианах по одному изображению TripoSplat можно запустить в Pinokio Для работы достаторчно 8ГБ VRAM #gaussian #image2scene #scenereconstrustion
NeoMME Поиск по PDF-документам без OCR. Страницы обрабатываются как изображения, поиск учитывает верстку, таблицы, графики и типографику - Ретривер для RAG: ищет нужные страницы PDF по запросу, а не генерирует ответ - Понимает визуальную структуру — таблицы, графики, колонки, дизайн страницы. OCR выбросил бы всё это - Загрузка документа + запрос → модель возвращает релевантные страницы - 2 размера: 260M и 800M — под разное железо Демо #vlm #ocr
OmniCam Камера-контроль в ComfyUI Rак мини-Blender внутри ноды. Три инструмента: извлечь камеру из видео, расставить кадры в 3D-вьюпорте, скомпилировать движение под нужную модель #comfyui #cameracontrol
Накопилось по #minimaxH3 - часть 18 github.com/StephanHeijl/storyboard-tools - раскадровка: кадры, правки, ассеты, попытки рендера и утверждения. Для людей и агентов #storyboard github.com/lovemachine100/ComfyUI-H3-OutpaintPrep - подготовка видео к аутпейнту: паддинг кадров и маски шума в формате H3 #outpainting huggingface.co/rootonchair/MiniMax-H3-nunchaku-lite-nvfp4 - MiniMax H3 в виде #Nunchaku Lite nvfp4 huggingface.co/speach1sdef178/MiniMax-H3-Semantic-Bridge - Semantic Bridge: адаптер 11Mb учит H3 понимать прозрачность, отражения, зеркала и руки. Для #FL2VA github.com/Heroesjouney/AIMovieStudiov2 - интерфейс для создания фильмов через AI. API для облачных моделей или ComfyUI локально. UI под кинопроизводство reddit.com/r/comfyui/comments/1w7e7sd/minimax_h3_combining_ref2va_qua…
Читать целикомWCDA (Weather-Conditioned Depth Anything) Новый #SOTA в оценке глубины в плохую погоду. Depth Anything проваливается в туман, дождь, снег и темноте. DA-W чинит это через стилевой фильтр, который выделяет погодные условия и адаптирует модель под них, не ломая то, что она умеет в хорошую погоду Гитхаб HF #image2depth #video2depth
Using GPT-6 Astra официальный гайд по промптингу Using GPT-6 Astra - Чётко задавать цель и критерии результата — вместо «сделай хорошо» указывать проверяемые условия (формат, ограничения, примеры, тесты). - Прописывать границы автономии — что модель может делать сама, а где нужно спрашивать. - Учитывать осторожность модели: по умолчанию она склонна задавать вопросы; если нужна инициативность, добавьте в системный промпт «bias towards action». - Избегать стоп‑слов и клише (например, «delve into», «leverage», «it’s worth noting»). - Ставить статичные инструкции в начало, динамические данные — в конец (для лучшего кэширования). - Выбирать уровень reasoning.effort осознанно: low для простых задач, high — для сложных архитектурных. - Для агентных сценариев явно описывать рабочий процесс и эта…
Читать целикомLing-3.0-flash-Fin Финансовая модель с открытыми весами и бенчмарк, который проверяет не ответ, а его источник. 124B MoE, 5.1B активных, 256K контекста — обучена на реальных банковских задачах, а не на абстрактных тестах - Финансовое дообучение подняло AA Intelligence Index с 38 до 41 — редкий случай, когда предметка улучшает базовые метрики - Выполняет реальные задачи в приватном контуре: поиск источников, анализ отчётности, оценка, сложные таблицы, редактируемые отчеты #finance