Предприятия, разрабатывающие и внедряющие ИИ-агентов, сталкиваются с проблемой: инженерам требуется слишком много времени, чтобы обнаружить ошибки в их работе, что приводит к зацикливанию проблем, особенно без человеческого контроля на каждом этапе. Платформа мониторинга и оценки LangSmith от компании LangChain представила новую функцию в режиме публичной бета-версии, призванную упростить решение этой задачи.
LangSmith Engine автоматизирует весь процесс: от обнаружения сбоев в работе систем до диагностики первопричин на основе актуальной кодовой базы, подготовки исправлений и предотвращения повторных ошибок (регрессий). Всё это происходит в рамках одного автоматизированного цикла. Хотя LangSmith Engine предлагает инженерам ИИ более быстрый путь к устранению неполадок, он выходит на уже переполненный рынок: такие гиганты, как Anthropic, OpenAI и Google, активно интегрируют функции мониторинга (observability) и оценки непосредственно в свои платформы.
Как LangSmith Engine выявляет и устраняет сбои
В своем блоге LangChain отметила, что стандартный цикл разработки ИИ-агентов начинается с отслеживания его работы (трассировки) для понимания действий, затем следует выявление пробелов, внесение изменений в запросы (prompts) и инструменты, а также создание эталонных наборов данных. Далее разработчики проводят эксперименты и проверяют отсутствие регрессий, прежде чем выпустить агента в эксплуатацию.
Однако проблемы возникают, когда анализ трассировок не выявляет ошибочных паттернов, повторение ошибок становится трудно отследить, а также отсутствует специализированный механизм оценки, способный уловить ту же проблему при ее повторении в производственной среде.
Согласно записи в блоге, LangSmith Engine отслеживает производственные трассировки по нескольким типам сигналов, включая «явные ошибки, сбои онлайн-оценщиков, аномалии трассировки, негативные отзывы пользователей и необычное поведение, например, когда пользователь задает вопросы, на которые агент не был запрограммирован отвечать».
Затем Engine анализирует актуальную кодовую базу, выявляет источник проблемы и автоматически генерирует запрос на слияние (pull request), а также предлагает индивидуальный механизм оценки для данного конкретного типа сбоя. Человек вмешивается только на этапе утверждения предложенных изменений.
Система построена на базе существующей инфраструктуры трассировки и оценки LangSmith и совместима с результатами собственных оценочных систем предприятий. В отличие от других инструментов мониторинга, таких как Weights & Biases, Arize Phoenix и Honeyhive, LangSmith Engine автоматически выполняет всю цепочку действий — от обнаружения сбоя и диагностики первопричины до подготовки исправления — подключая человека лишь на этапе утверждения.
Конкурентный ландшафт и мнения экспертов
Хотя LangSmith определила необходимость в подобном цикле оценки для многих компаний, Engine появляется в период, когда крупные поставщики моделей активно интегрируют инструменты мониторинга непосредственно в свои платформы. Это означает, что предприятия могут предпочесть использование комплексных платформ, а не внедрение LangSmith Engine в существующие рабочие процессы.
Например, Claude Managed Agents от Anthropic объединяет развертывание, оценку и оркестрацию агентов в едином комплексе. Платформа Frontier от OpenAI предлагает аналогичное сквозное решение для создания, управления и оценки корпоративных агентов, хотя обе компании сталкиваются с вопросами от предприятий, опасающихся привязки к одному поставщику.
Однако эксперты отмечают, что не все организации готовы полностью переносить функции оценки и мониторинга в рамках одной платформы. По словам Ли Кони, основателя и главного консультанта Workwise Solutions, в интервью VentureBeat, сторонние системы мониторинга являются стандартом для многих предприятий. Он отметил, что один из фондов, с которым он сотрудничает, использует Claude для анализа и GPT для отдельного рабочего процесса. Если мониторинг интегрирован в инструментарий каждого поставщика, то возникают две системы, которые не могут взаимодействовать друг с другом, и команде по соблюдению нормативов становится невозможно создать единый аудиторский след. Таким образом, сторонние решения для мониторинга сохраняют свою актуальность, поскольку использование нескольких моделей ИИ уже стало нормой в корпоративной среде, и требуется единый инструмент для работы с разными поставщиками.
Джессика Арредондо Мерфи, генеральный директор и соучредитель True Fit, подчеркнула, что независимые платформы, такие как LangSmith, должны доказать предприятиям свою способность «ответить на долгосрочный вопрос о том, станут ли они кросс-модельным операционным уровнем для обеспечения качества и надежности». По её мнению, предприятия не переходят на встроенные инструменты поставщиков моделей так быстро, как того хотели бы сами поставщики. Она отмечает прагматичное разделение: команды используют инструменты первого лица для быстрого внедрения и отладки на ранних стадиях, но как только речь заходит о надежности производства, управлении и долгосрочной гибкости, они, как правило, вводят более нейтральный уровень для мониторинга и оценки.
Доступность LangSmith Engine
LangSmith Engine уже доступен в публичной бета-версии. Команды могут подключить проект трассировки, при желании связать свой репозиторий, и Engine начнет автоматически выявлять проблемы из производственных трассировок.

