RAG | Нейросети | ИИ | AI | Агенты | Gemini 4 Argon | GPT-6.1 Sol | GPT-6 Astra | Claude Opus 5.5 | DeepSeek | Qwen 3.8
КаналIT и технологииНейросети и AI по делу: новые модели, агенты, инструменты и практичные приёмы.
Публикации канала
Лента каналаПять AI-инструментов недели: OpenDots — заготовка для своих AI-сотрудников, которые отвечают в Slack и принимают звонки. github.com/CopilotKit/OpenDots dots — 21 строка кода поверх invisible-playwright-mcp: даёт агенту браузер, который не банят. github.com/feder-cr/dots yomiyasu — скилл, который выправляет машинный перевод, чтобы японский звучал естественно (только японский). github.com/nanaism/yomiyasu answer-me-with-html — агент вместо чата отдаёт один читабельный HTML-файл с ответом. github.com/QingYunA/answer-me-with-html vibe-wise — плагин Claude Code, который объясняет, что агент делает, пока тот пишет код. github.com/nykooi1/vibe-wise #AI #дайджест
2«Агент сказал, что готово. База данных не согласилась» — так назвали блог в Microsoft и Hugging Face, когда выложили ThinkingBox. Это не модель, а песочница и бенчмарк: агентов гоняют по 507 бизнес-задачам и оценивают не текст ответа, а что реально записалось в базу. 67% провалов выглядят чисто — агент корректно вызвал инструменты и сказал «готово», но записал не то поле. Каждую задачу прогоняют по 20 раз. Kimi-K3 хотя бы раз решает 94%, а все двадцать — лишь 13%. Один удачный прогон ещё не надёжность.
3YODAS v3 — 1,1 млн часов речи, крупнейший открытый релиз в семействе YODAS. Сто с лишним языков, весь корпус в 48 кГц, и свыше 70% записей — настоящее стерео, а не размноженное моно. Теперь генерацию речи и пространственный звук можно учить без закрытых корпусов. С нуля на YODAS v3 собирают модель уровня Whisper, а на исходном YODAS поднимали Granite (IBM) и Canary/Parakeet (NVIDIA). Лицензия CC BY 3.0.
2Cloudflare выкатила собственную ML-модель, даже две — clef на 27B и clef-flash на 9B, обе под Apache 2.0. Это не генеративка — модель читает состояние и схему вопросов, за один проход выдаёт вероятность по каждому варианту, без reasoning-токенов и парсинга. Агентам как раз нужно: замаршрутизировать тикет, заблокировать запрос, эскалировать. clef-flash отвечает за 39 мс.
2Aleph Alpha (Германия) выложила Kolibri-1 — MoE на 78 млрд параметров, но за токен отвечают 6 экспертов из 384, так что влезает на один H200 через vLLM. Веса целиком: 78 ГБ FP8 под Apache 2.0, то есть open weights, а не open source. Немецкий в корпусе нативный (больше 20%) — редкий вариант для немецкоязычных задач. AIME 96,9 и GPQA Diamond 84,3 — собственные замеры Aleph Alpha, независимых пока нет.
4«Факт верный, а источник не тот». RAGAS, MiniCheck, AlignScore пропускают такое. Им хватает, что факт есть в пуле. ProvenanceGuard читает MCP-трейс и сверяет каждое утверждение с источником, который агент назвал. 138 непроходных утверждений из 139, полсекунды на ответ. Код не выложен. Строителям MCP-агентов: «grounded» это «поддержано любым инструментом» или «тем источником из ответа»? Второе ловит подмену.
13
Подписчики
14
Публикации
427
Обновление
5 октября 2026 г.
Первая публикация
28 июля 2026 г.
Активность канала
За 7 дней
9
публикаций
За 30 дней
117
публикаций
Просмотров за 90 дней
13 318
Ср. просмотров на пост
31