🗄 S3 можно использовать как общий слой хранения для ML и Big Data — 10 сентября 2026 г. в 15:46:19.750
🗄 S3 можно использовать как общий слой хранения для ML и Big Data В ML и Big Data одни и те же данные часто нужны сразу нескольким системам: Spark обрабатывает выборки, Trino записывает результаты, а несколько GPU-воркеров используют один датасет для обучения. ➡️ S3 позволяет вынести данные в общий слой хранения. Объекты доступны по HTTP, поэтому разные вычислительные системы и обучающие воркеры могут работать с ними параллельно — без обязательного копирования датасетов на каждую машину. Но просто сложить все в один бакет недостаточно. Для ML-проекта данные лучше сразу разделить по назначению: 🔹 датасеты — исходные и обработанные выборки в Object Storage 🔹 версии датасетов — DVC связывает состояние данных с конкретным коммитом кода, а сами файлы хранит в S3 🔹 фичи — например, в Parquet; отдельный feature store вроде Feast нужен, когда одни признаки используют несколько моделей и требуется онлайн-инференс 🔹 веса и артефакты экспериментов — MLflow хранит параметры и метрики, а тяжелые файлы можно складывать в S3. 📁 Есть еще один нюанс: в S3 нет настоящих папок. Поэтому структуру префиксов стоит продумать заранее.

