Думаю те, кто хоть немного следят за развитием LLM знают, что не так давно вышла Qwen3.... — 10 сентября 2026 г. в 06:11:01.911
Думаю те, кто хоть немного следят за развитием LLM знают, что не так давно вышла Qwen3.8-27B, которую может взять и использовать любой желающий. На неё очень хорошие отзывы, она реально умная и может успешно решать некоторые задачи. По моему опыту использования локальных моделей, именно модели Qwen давали самый хороший результат. В общем, очень мне хотелось тоже её попробовать. Но сразу скажу, что на видеокарте с 8ГБ это пустая затея, кто бы что ни говорил. Ничего путного у меня не получилось, а заметку делаю, чтобы сэкономить чьё-то время, если кто-то начнёт мечтать о невозможном и задумает проводить такие же эксперименты. Я перепробовал кучу настроек, но результата выше 2 токена в секунду не получилось. Теоретически, такой производительности может хватить на какие-то рутинные задачи, которые не требуют мгновенного выполнения, но у меня таких нет. А работать вручную с такой производительностью невозможно. Самые хорошие результаты были получены с настройками из этого видео: ▶️ Запустил Qwen3.8 27B на одной видеокарте 8 ГБ! (Лучше, чем ожидалось) - Модель - unsloth/Qwen3.8-27B-GGUF IQ4_XS - Context length - не более 70к - K и V Cache Quantization Type - Q4_0 - GPU Offload - 26 - CPU Thread Pool Size - по числу физических ядер CPU - Speculative Decoding - MTP - Max Draft tokens - 2 - Draft probability - 0.75 - Enable Thinking - True (поставить галку) - Reasoning Budget - Off (убрать галку) - Temperature - 1 - Top K Sampling - 20 - Repeat Penalty - 1 - Min P Sampling - 0 Остальное в дефолте. Не знаю, что там ожидалось (я про заголовок), но у меня иногда те же 2 токена в секунду на RTX 5060 8 ГБ получились, как и у автора. Иногда ниже. Я перечитал все комментарии с критикой и советами по изменению настроек, но лучше не стало. Пробовал некоторые другие советы - всё мимо. Потерял кучу времени, результата - 0. Теоретически можно ещё LLM помучать на тему этих настроек, но, думаю, смысла нет. Одно хорошо - уже прохладно стало, отопление ещё не включал, а пока с LLM работаешь🔥, кабинет обогревается до комфортной температуры. С такой видюхой, как у меня, про локальные модели общего назначения проще забыть и вообще их не запускать. Результат будет хуже, чем почти на всех публичных бесплатных. Другое дело какие-то специализированные модели, например, для распознавания объектов на видеопотоке, или анализ фотографий с тем же распознаванием объектов или лиц, распознавание речи. Это уже будет рабочая тема. Я всё это делал, нормально работает, производительности этой видюхи хватает. А в общении в чате или агентском режиме ловить нечего. Оно работает и даже что-то делает, но как я сказал, хуже бесплатных публичных моделей, так что смысла нет мучать своё железо, пока они доступны. А в целом модель умная. Поделал некоторые относительно простые вещи на ней. Работает медленно, но результат даже в такой заквантованной и ограниченной по ресурсам модели нормальные. Если чётко выдавать задания и не торопиться получить результат, она в фоне может делать дела. #ai