Специалисты факультета вычислительной математики и кибернетики (ВМК) МГУ создали методы, которые помогают быстрее обучать системы для распределения вычислительных задач в сети. Цель исследования — улучшить планирование вычислений, когда нагрузка на сеть постоянно меняется.
В нынешних вычислительных сетях — в том числе тех, что обрабатывают данные с устройств Интернета вещей, — задачи возникают в случайное время. Чтобы справляться с ними эффективно, нужно оперативно перераспределять нагрузку между узлами сети, ориентируясь на то, насколько загружены ресурсы в конкретный момент.
До этого для решения проблемы использовали многоагентное обучение с подкреплением: в такой схеме отдельные агенты контролируют разные участки сети, а центральный агент решает, как распределить между ними поступающие задачи. Но обучение подобных систем отнимает много времени и вычислительных мощностей — даже если речь идёт о сетях небольшого размера.
Как показали эксперименты, на обучение одной модели может уходить порядка десяти часов процессорного времени. А поскольку для подбора оптимальных параметров нужно запускать обучение многократно, весь процесс настройки становится чрезмерно долгим.
Учёные сконцентрировались на том, чтобы сделать обучение эффективнее. Они проанализировали, на что в первую очередь расходуются вычислительные ресурсы, и предложили ряд практических мер — например, исключить ненужное копирование данных и задействовать параллельные вычисления. Благодаря этому удалось заметно ускорить и сбор данных, и обучение моделей.
По словам Василия Балашова, старшего научного сотрудника лаборатории вычислительных комплексов факультета ВМК МГУ, благодаря оптимизации обучения время настройки системы существенно уменьшается — это делает подобные методы реально применимыми для управления вычислительными сетями.
После внедрённых улучшений время настройки системы снизилось до нескольких суток — с учётом того, что обучение прогоняется много раз.
Результаты исследования можно применять при создании систем управления вычислительными ресурсами — в частности, для распределённых сетей и инфраструктур, обрабатывающих данные.
Исследование представили на конференции «Ломоносовские чтения».
По материалам:
scientificrussia