Моделювання та розробка підсистеми формування раціональної поведінки агентів в модельному середовищі

Альтернативна назва
Modeling and development of a subsystem for forming rational behavior of agents in a model environmen
Ескіз недоступний
Дата
2025
Науковий керівник
Укладач
Редактор
Назва журналу
ISSN
E-ISSN
Назва тому
Видавець
Одеський національний університет імені І. І. Мечникова
Анотація
Кваліфікаційну роботу присвячено моделюванню та розробці підсистеми формування раціональної поведінки автономних агентів (БПЛА) в модельному середовищі. Проведено аналіз сучасних методів навігації, виявлено обмеження детермінованих алгоритмів та обґрунтовано доцільність використання навчання з підкріпленням у поєднанні з процедурною генерацією контенту . Спроєктовано багаторівневу архітектуру системи на базі платформи Unity та інструментарію ML-Agents, що включає три рівні абстракції: дискретний двовимірний простір, воксельний простір із частковою спостережуваністю та неперервне фізичне середовище . Реалізовано підхід до навчання агентів на основі алгоритму PPO з інтеграцією рекурентних блоків пам’яті (LSTM). Навчальну модель доповнено модулем внутрішньої винагороди (Curiosity) для вирішення проблеми розрідженої винагороди у середовищах. Розроблено комплексний модуль процедурної генерації, що використовує алгоритми когерентного шуму, клітинних автоматів для створення варіативних сценаріїв, а також механізм Curriculum Learning для адаптивного керування складністю завдань. Підсистему протестовано для формування раціональної поведінки агентів у двовимірному та воксельному просторі. Доведено, що використання LSTM забезпечило збільшення середньої кумулятивної нагороди на 20% у порівнянні з базовою моделлю PPO. Впровадження модуля Curiosity у воксельному середовищі дозволило сформувати поведінку агента, який здатен виконувати задачі у середовищах підвищеної складності. Розробка фізичної моделі дозволила сформувати стійку політику керування БПЛА у неперервному просторі. У розробленій підсистеми дослідник має можливість налаштовувати фізичні та сенсорні параметри агентів, спостерігати за процесом прийняття рішень та проводити симуляції у паралельному режимі з генерацією унікальних топологій середовища.
The qualification work is devoted to the modeling and development of a subsystem for the formation of rational behavior of autonomous agents (UAVs) in a model environment. An analysis of modern navigation methods was conducted, limitations of deterministic algorithms were identified, and the feasibility of usingreinforcement learning in combination with procedural content generation was substantiated. A multi-level architecture of the system was designed based on the Unity platform and the ML-Agents toolkit, which includes three levels of abstraction: discrete two-dimensional space, voxel space with partial observability, and a continuous physical environment. An approach to training agents based on the PPO algorithm with the integration of recurrent memory blocks (LSTM) was implemented. The training model was supplemented with an internal reward module (Curiosity) to solve the problem of sparse reward in environments. A complex procedural generation module has been developed that uses coherent noise algorithms, cellular automata to create variant scenarios, as well as the Curriculum Learning mechanism for adaptive task complexity management. The subsystem has been tested to form rational agent behavior in twodimensional and voxel space. It has been proven that the use of LSTM provided an increase in the average cumulative reward of 20% compared to the basic PPO model. The implementation of the Curiosity module in the voxel environment made it possible to form the behavior of an agent capable of performing tasks in environments of increased complexity. The development of a physical model made it possible to form a stable UAV control policy in continuous space. In the developed subsystem, the researcher can configure the physical and sensory parameters of agents, observe the decision-making process, and conduct simulations in parallel with the generation of unique environment topologies.
Опис
Ключові слова
126 Інформаційні системи та технології, кваліфікаційна робота, магістр, моделювання, сучасні методи навігації, машинне навчання
Бібліографічний опис
Рябов Д. А. Моделювання та розробка підсистеми формування раціональної поведінки агентів в модельному середовищі = Modeling and development of a subsystem for forming rational behavior of agents in a model environmen : кваліфікаційна робота магістра / Д. А. Рябов. – Одеса, 2025. – 113 с.
DOI
ORCID:
УДК