Команда Qwen, подразделение компании Alibaba, анонсировала выпуск проекта Qwen-AgentWorld. В отличие от традиционных подходов, где искусственный интеллект обучают совершать действия в среде, новые модели специализируются на прогнозировании ответных реакций этих сред. Технология охватывает семь направлений: работу с протоколом MCP, поисковые системы, терминалы, программную инженерию, Android, веб-интерфейсы и операционные системы.
Решение проблемы ограниченности тренировочных данных
Современные агенты часто сталкиваются с «потолком» возможностей при обучении на реальных данных. Поисковики выдают лишь существующие результаты, не позволяя моделировать специфические условия, а «живые» терминалы не могут по требованию имитировать, например, нехватку дискового пространства. В результате агенты редко сталкиваются с редкими, но критически важными сценариями.
Qwen-AgentWorld меняет вектор обучения: вместо вопроса «какое действие совершить в текущей среде» модель отвечает на вопрос «какое состояние среды последует за этим действием». Такой подход позволяет создать «языковую модель мира», обучающуюся предсказывать динамику системы по единому алгоритму для всех семи областей.
- Первый этап: обучение поведению сред — файловых систем, ответов API и структуры DOM-деревьев браузеров.
- Второй этап: развитие навыков логического рассуждения о будущих изменениях.
- Третий этап: обучение с подкреплением с использованием правил и систем оценки качества.
Технические характеристики и результаты тестов
В разработке использованы модели архитектуры Mixture-of-Experts, где в процессе обработки каждого запроса задействуется лишь часть параметров. Младшая версия модели обладает 35 миллиардами параметров (активны 3 миллиарда), старшая — 397 миллиардами (активны 17 миллиардов). Обе модели поддерживают контекстное окно объемом 256 тысяч токенов. Для работы с графическими интерфейсами используются текстовые деревья доступности и иерархии UI, а не анализ скриншотов.
Исследователи отмечают, что использование контролируемых симуляций дает значительный прирост производительности. Например, в тестах MCPMark показатели выросли с 24,6 до 33,8 баллов за счет внедрения искусственных «возмущений» и редких краевых случаев. Применение данных моделей в качестве этапа «разогрева» перед основной настройкой агентов позволило улучшить результаты на бенчмарках BFCL v4 с 62,29 до 71,25 и Claw-Eval с 53,60 до 64,88.
Оценка экспертного сообщества
Специалисты в области машинного обучения подчеркивают важность данного исследования. Эксперты отмечают, что возможность синтетической тренировки может стать полноценной альтернативой обучению с подкреплением в реальных средах, которое сложно масштабировать. Однако существует риск переобучения под особенности симулятора: если модель мира будет «слишком чистой», агент начнет подстраиваться под её специфику, а не под реальную задачу.
В обзоре подчеркивается, что для команд, работающих над агентными системами, это исследование открывает новый путь: синтетические среды становятся важным инструментом для подготовки агентов к нестандартным ситуациям, которые практически невозможно воспроизвести в производственных условиях.
* — деятельность компании запрещена на территории РФ
