ПОРІВНЯННЯ ШВИДКОДІЇ РЕАЛІЗАЦІЙ ЯВНОГО МЕТОДУ ЕЙЛЕРА ДЛЯ АНСАМБЛЮ ТРАЄКТОРІЙ СИСТЕМИ РАКЛІДЖА В MATLAB
DOI:
https://doi.org/10.31891/2219-9365-2026-87-55Ключові слова:
явний метод Ейлера, система Ракліджа, MATLAB, векторизація, parfor, CUDA, OpenMP, MEX, хаотична система, пакетні обчислення, пропускна здатність пам'ятіАнотація
Швидкодія обчислення значень великих ансамблів незалежних траєкторій динамічних систем обмежується не лише швидкістю власне обчислень, але й організацією паралельної роботи, зберіганням проміжних станів системи і передаванням даних між рівнями пам'яті. У попередніх дослідженнях швидкодії зазвичай використовують різні моделі, розв'язувачі або апаратні конфігурації, тому ці чинники неможливо відокремити за незмінної рекурентної формули. У роботі визначено, яка реалізація явного методу Ейлера забезпечує найменший час виконання для ансамблю траєкторій системи Ракліджа у трьох сценаріях використання даних. На одній сітці параметрів 200 × 200 досліджено скалярні та векторизовані реалізації MATLAB на центральному процесорі (CPU), ThreadPool/parfor, операції gpuArray на графічному процесорі (GPU), спеціалізовані ядра CUDA та реалізації C++ MEX з OpenMP і SIMD. Повний експеримент охоплював 40 000 незалежних траєкторій, 307 674 кроки Ейлера для кожної траєкторії та 12,307 млрд оновлень трьох компонентів стану. Більшість конфігурацій виміряно у 15 повних повторах, а результати узагальнено за медіаною та міжквартильним розмахом (IQR). У сценарії зі збереженням лише кінцевого стану дворівнева CPU-реалізація з вісьмома workers і блоками по 1 750 траєкторій скоротила медіанний час обчислення з подвійною точністю з 45,232 с (IQR 0,744 с) до 2,076 с (IQR 0,163 с), тобто у 21,78 раза. Ядро CUDA, що виконувало 5 000 послідовних кроків Ейлера за один запуск, потребувало 2,119 с (IQR 0,0014 с) з подвійною точністю та 0,291 с (IQR 0,0014 с) з одинарною точністю. У сценарії збереження повної історії CUDA strict single записувала часові ряди у відеопам'ять (VRAM) за 0,598 с (IQR 0,00035 с), однак послідовне передавання всіх блоків до оперативної пам'яті (RAM) збільшувало оцінений час конвеєрної обробки до 25,35 с. Наведене значення 18,873 с для CPU classic+parfor зі збереженням повної історії є оцінкою критичного шляху за максимальним часом worker, а не повним часом розрахунку. Варіанти арифметики CUDA порівнювали за контрольними сумами кінцевих станів, які є діагностичними показниками, а не доказом еквівалентності окремих траєкторій.
##submission.downloads##
Опубліковано
Як цитувати
Номер
Розділ
Ліцензія
Авторське право (c) 2026 Олександр РАЗОВИЙ, Олег ГОЛЕВИЧ

Ця робота ліцензується відповідно до Creative Commons Attribution 4.0 International License.


