Нейроканал
IT и технологии
Искусственный интеллект, нейросети, машинное обучение Сайт: https://tprg.ru/site
Загружаем канал…
Мы используем файлы cookie для работы сайта и аналитики посещаемости. Подробнее в Политике обработки данных и Правилах.
IT и технологии
Искусственный интеллект, нейросети, машинное обучение Сайт: https://tprg.ru/site
Тот же Кун Чен выложил /no-mistakes — скилл, который запускается после того, как агент внёс изменения в код. Одной командой он прогоняет правки через единый конвейер: авто-ревью кода, тесты, линт, обновление документации, потом push, пул-реквест и CI. Скилл ставится в Claude Code, Codex и другие агенты через no-mistakes init или npx skills add kunchenguid/no-mistakes. Под капотом он управляет утилитой no-mistakes axi из набора инструментов автора. Совет: вешайте такую проверку на момент «агент сказал, что готово» — ловит пустые тесты, забытый линт и недописанную документацию до того, как правки уедут в репозиторий. @neuro_channel
И ещё немного про железо и куда ветер дует. Сегодня у меня какое-то настроение про абстрактное поговорить, а не новые модели обозревать. Так вот. Сейчас языковую модель гоняют на универсальной видеокарте, где веса постоянно курсируют между памятью и вычислительными ядрами. Эта пересылка и есть главный тормоз. Канадский стартап Taalas зашёл иначе и впечатал Llama 3.1 8B прямо в кремний: веса запекли в транзисторы чипа, и память-посредник больше не нужна. На выходе около 17 тысяч токенов в секунду на пользователя, это в десятки раз быстрее топовой видеокарты на той же модели, плюс дешевле и экономичнее по энергии. Расплата за скорость: такой чип навсегда заточен под одну модель, обновить веса нельзя, и контекст у неё маленький. Но направление понятное: по мере того как архитектуры устакан…
Читать целикомИ Code Arena подтянулась: GLM-5.2 на втором месте, сразу после Fable. С учётом что Fable отключена, по факту на первом месте среди реально работающих моделей. Т.е. вот буквально так это понимать: для разработки фронтента лучшая в мире модель сейчас GLM-5.2, с открытыми весами. @neuro_channel
И Code Arena подтянулась: GLM-5.2 на втором месте, сразу после Fable. С учётом что Fable отключена, по факту на первом месте среди реально работающих моделей.
Кстати, про Fable. Стали известны подробности того, за что на самом деле отключили модель. Напомню: 9 июня Anthropic открыла доступ к Fable 5 и Mythos 5, а 12 июня по требованию министра торговли США отключила их по всему миру, формально из-за «взлома», который якобы позволял использовать модель для поиска уязвимостей в чужом коде. Теперь содержание того закрытого отчёта разобрала Кэти Муссурис, основательница Luta Security и человек, запустивший первые программы поиска уязвимостей в Microsoft и Пентагоне. Она оказалась единственным внешним экспертом, прочитавшим документ, и денег от Anthropic за это не получает. Весь «взлом» выглядел так: модели дали открытый код с известными уязвимостями и попросили проверить его на проблемы безопасности — Fable 5 отказалась. Тогда её попросили просто …
Читать целикомЕщё одна новинка — на опенраутере появился пакетный вариант anthropic/claude-sonnet-5.5:batch. Внутри та же модель Claude Sonnet 5.5 с контекстом в 1 млн токенов, но токены стоят ровно вдвое дешевле обычной версии: $1 за миллион входных и $5 за миллион выходных вместо стандартных $2 и $10. Запросы отправляются через Batch API и обрабатываются асинхронно в окне до 24 часов, при этом окно задаёт предельный срок ожидания, а не гарантию успешного выполнения всех задач. Формат подходит для несрочных сценариев: фоновой разметки данных, обработки архивов или массовых тестов. @neuro_channel
В OpenRouter появилась версия openai/gpt-6.1-sol-pro. Это та же модель GPT-6.1 Sol, но с режимом более глубоких и длинных рассуждений для сложных задач. Базовый тариф за токены такой же, как у обычной версии: $2 за миллион входных и $10 за миллион выходных. Для длинных промптов свыше 272 000 токенов действуют расценки $4 за вход и $15 за выход. При этом итоговый запрос обходится ощутимо дороже и выполняется дольше, так как модель генерирует гораздо больше токенов рассуждений. @neuro_channel
В OpenRouter появилась бесплатная модель inclusionai/ling-3.1-flash от компании inclusionAI: за входные и выходные токены сейчас платить не нужно. По архитектуре это MoE, 25 млрд активных параметров из 560 млрд, с поддержкой гибридных рассуждений. Контекстное окно составляет 262 тыс. токенов, из коробки поддерживается вызов внешних инструментов. Запускать модель можно через стандартный API или прямо в веб-интерфейсе. @neuro_channel
В OpenRouter появилась бесплатная модель apodex/apodex-1.1-mini:free. Платить за токены не нужно, но действуют ограничения на частоту запросов. По описанию команды, это reasoning-модель для исследовательских и прогнозных задач, аналитики данных и работы с кодом. Контекстное окно составляет 262 тыс. токенов. В API поддерживаются вызов внешних инструментов и структурированные ответы. @neuro_channel
NVIDIA и Университет Ватерлоо опубликовали мультимодальную модель PixelUMM, которая объединяет понимание и генерацию визуального контента. Она принимает фото, видео и текст, отвечает текстом и сама генерирует изображения или ролики прямо в сырых пикселях, без VAE и отдельного визуального энкодера. Языковой базой служит Qwen3-8B, но в полном чекпоинте 15,2 млрд параметров из-за раздельных экспертов для понимания и генерации, связанных общим вниманием. Архитектура позволяет брать входное изображение за основу и развивать его в видеоряд: на визуализации авторов в первой колонке дан исходный кадр, а следующие кадры сгенерированы моделью. Веса выпущены только для некоммерческих исследований и оценки под лицензией NVIDIA One-Way, а код доступен в основном под Apache 2.0 с заимствованным модуле…
Читать целикомУ Claude Opus 5.5 просел результат в NerfBench: со 103,8% вчера до 94,2% сегодня. BridgeMind сообщила, что пока это укладывается в обычный разброс и говорить о нерфе рано. Бенчмарк проверяет, как модель меняется после релиза. Её стартовый результат принимают за 100%, затем повторяют испытания и сравнивают с ним. В итоговом индексе учитывают качество решения задач, расход токенов и стоимость. Авторы описали, что показатель может снизиться даже при прежнем качестве ответов, если модель тратит больше токенов или денег. Проценты здесь относительно собственного старта каждой модели, поэтому интеллект Opus и Sol по ним не сравнить. Диапазон 90–110% авторы считают нормальным разбросом. При этом задания, веса и способ выявления ухудшений закрыты, поэтому независимо воспроизвести их выводы по опу…
Читать целиком