RAG | Нейросети | ИИ | AI | Агенты | GPT-6.1 Sol | GPT-6 Astra | Claude Opus 5.5 | Gemini 3 | Qwen 3.8 | DeepSeek
IT и технологии
Нейросети и AI по делу: новые модели, агенты, инструменты и практичные приёмы.
Загружаем канал…
Мы используем файлы cookie для работы сайта и аналитики посещаемости. Подробнее в Политике обработки данных и Правилах.
IT и технологии
Нейросети и AI по делу: новые модели, агенты, инструменты и практичные приёмы.
MCP — главный протокол для AI-агентов — перешёл с WebSocket на HTTP. Теперь stateless. Раньше каждый клиент приклеивался к своему серверу: масштабировать было больно. Сейчас обычный HTTP — round-robin, кеширование, любой балансировщик из коробки. Плюсом: Tasks для долгих операций, Multi Round-Trip для уточнений, Enterprise-авторизация. SDK обновлены: TS, Python, Go, C#. Anthropic, AWS, Cloudflare, Microsoft, GCP поддержали с первого дня.
Модели отлично справляются с одной задачей. Но заставьте их переключаться между навыками, и точность рушится. Это не баг, а системная проблема: LLM не умеют удерживать несколько контекстов сразу. Gen-Verse замерили масштаб на 558 навыках и 12 моделях — страдают все, от Claude до Qwen. Решение: Skill Entropy RL, RL-трюк который учит модель не «забывать» предыдущий навык. Qwen3-4B после тренировки поднялся с 34% до 68%. Код на GitHub (MIT), статья на arXiv.
RLVR учит модель не ошибаться. Но вместе с ошибками она перестаёт искать альтернативы. Прогнали четыре модели через BODHI-деревья до и после RL-тренировки. Семантическое разнообразие схлопнулось: модель выдаёт один путь вместо веера. Не догадка — замер через ΔCPE, подтверждён на Qwen3-8B и Gemma3-12B. RLVR даёт точность ценой вариативности. Для креативных задач — спорный инструмент.
Cloudflare: 57,3% веб-трафика — боты. Впервые машин в интернете больше, чем людей. Рост не от классических краулеров. ИИ-агенты нарастили число запросов на 1 700% за год. При этом 51,8% всех краулеров заняты сбором данных для обучения моделей — не для выдачи. Интернет, каким мы его знали, заканчивается. И это данные, а не футурология.
OpenHarness от HKUDS — харнесс для AI-агентов. 15К звёзд, MIT, 43+ инструмента. Главное тут ohmo: агент в Telegram или Discord поверх Claude Code и Codex. Кидаешь задачу в чат, он идёт работать. Память, sub-agents, разрешения на месте.
Три инструмента уже умеют миксовать локальные и облачные модели в одном агенте. Cline разводит Plan и Act по разным моделям. Aider даёт три слота (main, editor, weak), и правило тут не про сложность, а про способности. Continue подмешивает локальный автокомплит к облачному чату. Рецепт простой: дорогую модель на творческую работу, дешёвую на проверяемую. Jackson Ly собрал конфиги для всех трёх.
Aleph Alpha (Германия) выложила Kolibri-1 — MoE на 78 млрд параметров, но за токен отвечают 6 экспертов из 384, так что влезает на один H200 через vLLM. Веса целиком: 78 ГБ FP8 под Apache 2.0, то есть open weights, а не open source. Немецкий в корпусе нативный (больше 20%) — редкий вариант для немецкоязычных задач. AIME 96,9 и GPQA Diamond 84,3 — собственные замеры Aleph Alpha, независимых пока нет.
«Факт верный, а источник не тот». RAGAS, MiniCheck, AlignScore пропускают такое. Им хватает, что факт есть в пуле. ProvenanceGuard читает MCP-трейс и сверяет каждое утверждение с источником, который агент назвал. 138 непроходных утверждений из 139, полсекунды на ответ. Код не выложен. Строителям MCP-агентов: «grounded» это «поддержано любым инструментом» или «тем источником из ответа»? Второе ловит подмену.
Работаете с синтезом речи — открытые модели можно сравнить за часы, а не недели голосования. Hugging Face запустил Open TTS Leaderboard. Метрики: разборчивость (WER/CER), скорость (RTFx, время до первого звука), похожесть голоса (WavLM). Выводы можно послушать. Дополняет арены, не заменяет: WER и SIM не меряют естественность.
У Ai2 вышла AstaBrief 8B — модель, которая пишет научный отчёт со ссылками за один проход. 51,1 секунды против 178,5 у Claude-пайплайна с размышлением, в 3,5 раза быстрее. Качество не просело: 87,0 против 86,2 в SQABench-CS2. Крутится локально — неопубликованные данные не уходят за файрвол. Веса открыты (Apache 2.0), датасеты под некоммерческой CC BY-NC 4.0. База Qwen3-8B.
Кодинг-агенты с февраля жгут в ~14 раз больше токенов, ~70% из них — кэш-промпты. NVIDIA с NTU и MIT предлагает резать расход в обвязке, а не в модели. SoL-Pi гоняет research-AI: тот придумывает правки harness и оставляет только те, что экономят деньги без потери качества. Минус 49% токенов при 94% счёта. Сессия подешевела с $1 787 до $894. Оговорки: Terminal-Bench 4 — 15/63 против 18/63 у нативных, а механизмы выучены под GPT-5.6 Sol, на чужой модели мягче.