DiscoverГриненко проЛокальные нейросети на MacBook: зачем, как выбрать, MLX, квантование, Dense vs MoE | Кир Белевич
Локальные нейросети на MacBook: зачем, как выбрать, MLX, квантование, Dense vs MoE | Кир Белевич

Локальные нейросети на MacBook: зачем, как выбрать, MLX, квантование, Dense vs MoE | Кир Белевич

Update: 2026-04-30
Share

Description

Обсуждаем локальные большие языковые модели (LLM) с Киром Белевичем — техническим руководителем, ex-Яндекс и автором SVGO.


Разбираемся, зачем запускать нейросети на своём MacBook, когда есть подписка на ChatGPT и Claude за $20. Как ИИ меняет разработку, почему vibe-coding ведет к деградации инженеров, как выбрать идеальную модель на Hugging Face и что такое квантование, MLX, GGUF и RAG.


Если вы хотите понять, как работают локальные LLM, убьет ли ИИ джунов и стоит ли покупать Mac Studio ради домашнего инференса — этот выпуск для вас!


Больше интересного в телеграм-канале DevSpotting.


⏱ Тайм-коды

00:37 - Вступление

02:40 - Кто такой Кир Белевич?

03:21 - Как MacBook (M2 Max) справляется с LLM: шум, нагрев и сценарии использования

06:36 - Почему локальные модели, а не облачные гиганты (Anthropic/OpenAI)?

10:21 - Self-host философия: зачем нужна независимость от корпораций

11:32 - Главный минус Vibe-coding: ИИ не должен заменять мозг разработчика

14:10 - Сравнение качества открытых моделей с проприетарными

16:31 - Как ИИ помогает продакт-менеджерам в быстром прототипировании

20:17 - Деградация индустрии: почему зумеры становятся новыми скрипт-кидди

21:57 - Локальная база знаний (RAG), векторные БД и DeepSeek для ресёрча

25:23 - Практика: как выбрать модель на Hugging Face?

28:43 - Что такое квантование моделей и как оно влияет на «ум» нейросети

36:36 - Как измеряют деградацию ИИ: Perplexity и KLD

41:13 - MLX, GGUF и победа динамического квантования Unsloth

42:16 - Почему бенчмарки (SWE-bench) больше не работают

49:26 - Движки инференса: Llama.cpp как Linux в мире ИИ

51:54 - Speculative Decoding и битва за размер контекста

01:00:39 - Архитектуры моделей: Dense vs MoE (Mixture of Experts)

01:14:12 - Можно ли файн-тюнить на маке?

01:19:26 - Снятие цензуры

01:21:32 - Будущее разработчиков: почему на вакансию CTO присылают 1000 ИИ-откликов

01:28:40 - ИИ никуда не уйдет: ищите свое место под солнцем


📌 Затронутые технологии и темы:

  • Hugging Face https://huggingface.co/ — как гитхаб, только для нейросетей
  • MLX: фреймворк машинного обучения от Apple (Metal API)
  • Llama.cpp & LM Studio: инструменты для локального запуска LLM
  • Unsloth & AWQ: форматы и инструменты для квантования моделей
  • Сравнение KLD и PPL для разных моделей https://github.com/deepsweet/mlx-eval/tree/main/results (инструменты для сравнения: https://github.com/deepsweet/mlx-eval)
  • Рекомендуемая Киром модель для макбука на 48Гб памяти: https://huggingface.co/deepsweet/Qwen3.6-35B-A3B-MLX-oQ4


📌 Кир в интернете

  • https://kir.belevi.ch/
  • https://t.me/deepsweet
  • https://github.com/deepsweet
  • https://huggingface.co/deepsweet


🔔 Не забудьте подписаться на Telegram-канал: https://t.me/devspotting

👍 Ставьте лайк и подписывайтесь на канал!

Comments 
loading
00:00
00:00
x

0.5x

0.8x

1.0x

1.25x

1.5x

2.0x

3.0x

Sleep Timer

Off

End of Episode

5 Minutes

10 Minutes

15 Minutes

30 Minutes

45 Minutes

60 Minutes

120 Minutes

Локальные нейросети на MacBook: зачем, как выбрать, MLX, квантование, Dense vs MoE | Кир Белевич

Локальные нейросети на MacBook: зачем, как выбрать, MLX, квантование, Dense vs MoE | Кир Белевич