Урок №2. Локальная LLM: LM Studio и MTP-модель | Настройки и запуск Теста №1 (10 экспериментов)

12+
12+

9 просмотров

15 часов назад

ПожаловатьсяНарушение авторских прав
12+
12+

9 просмотров

15 часов назад

ПожаловатьсяНарушение авторских прав
12+
12+

9 просмотров

15 часов назад

Урок №2. MTP на практике: какую модель выбрать, как установить и как измерить ускорение Во втором уроке курса «Multi-Token Prediction (MTP): ускоряем локальные LLM» переходим от теории к практике. ☕ Поддержать развитие проекта: ➡ Boosty: https://boosty.to/dmitrycherkashin_ai/posts/8f1f8eb1-7b95-4c90-92da-6f29e1b72dd9?share=post_link Спасибо за поддержку! 🙌 Сначала с нуля установим LM Studio, разберёмся с интерфейсом и загрузим MTP-модель. Затем рассмотрим основные настройки MTP и перейдём к практическим экспериментам. В этом уроке запускаем вариативный Тест №1, состоящий из 10 экспериментов с различными параметрами. Для сравнения проверяем работу модели с MTP и без MTP. Тест №1 — генерация обычного текста. Промпт: «Напиши статью про развитие искусственного интеллекта размером примерно 1000 токенов». Наиболее существенный результат в проведённых экспериментах: Без MTP — 6,45 token/s С MTP — 11,48 token/s В следующем уроке продолжим серию экспериментов и проведём вариативные Тесты №2–6, которые были определены в первом уроке, чтобы посмотреть, как меняется результат MTP в зависимости от типа задачи. Глава 1: Как на самом деле работает LM Studio: https://youtu.be/GqsioB_IIq8 Глава 2. Память модели: RAM, VRAM, Context Length и KV Cache: https://youtu.be/_M82afjcQTw Глава 3. Русские буквы в пути к модели: https://youtu.be/5xMFyNh4l98 Глава 4. большой Context Length = проблема Ссылка для вставки в описание: https://youtu.be/5yhQ5aj4b3w Глава 6: Q4 vs Q8. ЧТО ВЫБРАТЬ? Quantization: https://youtu.be/OnhRNt5PM9o Глава 7. FLASH ATTENTION = СКОРОСТЬ × 2? https://youtu.be/rqGGgY0s-W8 Выпуск про Batch Size: 10 распространённых ошибок при настройке LM Studio. Batch Size - где заканчивается польза увеличения Ссылка для вставки в описание: https://youtu.be/3P2eCRcbG0w Тайм коды: 00:00 Введение: принцип работы MTP и цели урока 01:06 Кто выпускает MTP-модели и форматы GGUF 01:43 Как правильно выбирать сборки на Hugging Face 02:50 Установка LM Studio с нуля (разница между LM Studio и Bionic) 04:44 Первичная настройка LM Studio и Developer Mode 06:33 Параметры моделей, Chat Template и квантование (Q3 vs Q4) 09:33 Поиск и скачивание Qwen 2.5 27B MTP GGUF (Q4_K_M) 11:13 Настройка параметров загрузки: Context Length, GPU Layers, Flash Attention 14:40 Подготовка к первому тесту и режим Thinking 15:32 Эксперимент 1: Контекст 8192, Draft Tokens = 1 (Thinking ON) 16:21 Эксперимент 2: Контекст 8192, Draft Tokens = 2 (Thinking ON) 16:47 Эксперимент 3: Контекст 8192, Draft Tokens = 3 (Thinking ON) 17:14 Эксперимент 4: Контекст 8192, Draft Tokens = 4 (Thinking ON) 17:49 Эксперимент 5: Контекст 8192, Draft Tokens = 4 (Thinking OFF) 18:20 Эксперимент 6: Контекст 8192, MTP OFF (Базовый тест) 19:11 Эксперимент 7: Контекст 4096, Draft Tokens = 2 19:52 Эксперимент 8: Контекст 4096, Draft Tokens = 3 20:27 Эксперимент 9: Контекст 4096, Batch Size 1024, Draft Tokens = 2 21:12 Эксперимент 10: Контекст 4096, Batch Size 512, MTP OFF 21:53 Итоги 10 экспериментов, сравнение скорости и выводы 22:54 Оптимальный профиль настроек и анонс Урока №3

Название:

Урок №2. Локальная LLM: LM Studio и MTP-модель | Настройки и запуск Теста №1 (10 экспериментов)

Категория:

Обучение