Edge of Context

Автоматический перевод Эта статья была автоматически переведена с оригинальной английской версии.

Практические заметки о компонентах AI-систем, которые должны выдерживать production: агентах, оценке, безопасности, памяти, retrieval, model engineering и инфраструктуре.

Ниже можно выбрать путь по задаче: агентные системы, оценка или retrieval и языковые системы. Для более кратких руководств по принятию решений используйте Краткие ответы.

С чего начать

Три пути к материалам

Главная серия

По порядку. Начните с цикла.

Листайте все шесть частей →

  1. 01 Циклы ризонинга AI-агентов: ReAct, ReWOO и Plan-and-Execute 11 мин
  2. 02 Архитектура памяти ИИ-агента: чекпоинты и векторные хранилища 17 мин
  3. 03 Tool use ИИ-агентами: MCP, CLI, Skills и выполнение кода 20 мин
  4. 04 Безопасность ИИ-агентов: разрешения, сэндбоксы и угрозы MCP 31 мин
  5. 05 Рантайм долгоживущих ИИ-агентов: сессии и чекпоинты 34 мин
  6. 06 Харнесс-инжиниринг для ИИ-агентов: проектирование контуров управления 21 мин

Все статьи 33

  1. Инженерия моделей · ИИ-инфраструктура

    Руководство по квантизации моделей: от основ до продакшен-сервинга

    Практическое руководство по выбору вариантов квантизации LLM и diffusion-моделей с учетом боттлнека, железа, runtime-ядра, калибровочных данных и проверок перед деплоем.

    · 23 мин

  2. Поисковые и языковые системы

    Гайд по NER на 2026 год: GLiNER, spaCy, Transformers и LLMs

    NER в 2026 году — это выбор между GLiNER, spaCy, Transformers и извлечением с помощью LLM с учётом латентности, точности и контроля схемы.

    · 30 мин

  3. ИИ-агенты Часть 1

    Циклы ризонинга AI-агентов: ReAct, ReWOO и Plan-and-Execute

    Сравнение ReAct, ReWOO и Plan-and-Execute для AI-агентов. Примеры на LangGraph показывают, как каждый цикл балансирует между адаптивностью, стоимостью, латентностью и структурой планирования.

    · 11 мин

  4. ИИ-агенты

    Enterprise RAG Challenge 3: уроки из публичных решений

    Что публичные решения Enterprise RAG Challenge 3 показывают об итерациях промптов, валидации, стратегиях работы с контекстом, обёртках над инструментами и архитектуре агентов.

    · 9 мин

  5. ИИ-агенты · Инженерия моделей

    Ризонинг по схеме: vLLM, XGrammar и Pydantic

    Как Schema-Guided Reasoning использует vLLM, XGrammar, схемы Pydantic и constrained decoding, чтобы принудительно обеспечивать структурно валидные ответы LLM.

    · 10 мин

  6. ИИ-агенты

    Предметно-ориентированное проектирование для ИИ-агентов: контексты и правила

    Как предметно-ориентированное проектирование помогает ИИ-агентам использовать общий язык, ограниченные контексты, сервисы, репозитории и детерминированные бизнес-правила.

    · 7 мин

  7. ИИ-агенты · Инструменты разработчика

    Туториал по MCP-серверу: сборка с Python, uv и FastMCP

    Создайте собственный MCP-сервер с помощью uv и FastMCP, предоставьте инструменты ML-фичестора, протестируйте их локально и подключите сервер к Claude Desktop.

    · 7 мин

  8. Инструменты разработчика

    Stable Diffusion на macOS: сравнение локальных инструментов для изображений

    Сравнение локальных инструментов для генерации изображений на macOS по установке, поддержке моделей, управлению пайплайном, воспроизводимости, расширениям и статусу сопровождения.

    · 6 мин

  9. Инженерия моделей · Инструменты разработчика

    Локальные LLM на macOS: Ollama, LM Studio, MLX, llama.cpp

    Сравнение инструментов для локальных LLM на macOS по интерфейсу, формату модели, запасу памяти, доступности API и рабочему процессу разработки на Apple Silicon.

    · 6 мин

  10. Инструменты разработчика

    Файлы запуска Zsh: .zprofile и .zshrc в macOS и Linux

    Разбираем файлы запуска Zsh: когда в macOS и Linux загружаются ~/.zprofile и ~/.zshrc, что помещать в каждый из них и как определить режим запущенного shell.

    · 4 мин

  11. Инженерия моделей · ИИ-инфраструктура

    Масштабирование LLM с помощью мульти-GPU и мультиузельного параллелизма

    Как масштабировать большие языковые модели на GPU и узлы с помощью параллелизма по данным, полностью шардированного, тензорного, конвейерного, контекстного и экспертного параллелизма.

    · 8 мин