Сообщения

Разворачиваем среду для машинного обучения MLflow в облаке MAIL.RU

Изображение
Обещал, что буду понемногу публиковать посты про data engineering и machine learning, и вот как раз появилась возможность поделиться результатами кейса по разворачиванию среды для машинного обучения MLflow. Мой кейс повторяет оригинальную презентацию ребят из Mail.ru, однако я оптимизировал шаги прохождения, плюс обратил внимание на некоторые нюансы, которые могут возникнуть, когда пытаешься его пройти. Оригинальные материалы к кейсу можете найти по ссылке внизу поста. Облачный провайдер Mail.ru любезно предоставил 3000 бонусных рублей на тестирование их продукта, что является отличной возможностью познакомиться с их облаком. Source: https://res.infoq.com/presentations/mlflow-databricks/en/slides Итак, а зачем вообще нам нужен фреймворк для ML? Фреймворк представляет удобный интерфейс к моделям и их параметрам. Ведет историю и сохраняет результаты каждого запуска модели, хранит артефакты для моделей. Легко нужно найти информацию когда, какую модель запускал, какие были результаты, ...

Принципы хорошей дата-аналитики

Изображение
Анализ данных труден. Что делает его трудным, так это его интуитивный аспект - знание направления, в котором вы хотите двигаться, на основе ограниченной информации, которая у вас есть в данный момент. Кроме того, что еще больше усложняет озвучивание результатов и демонстрацию почему ваше исследование правильно - уметь делать это глубоко, масштабно и последовательно. Вот несколько принципов, которые помогут при анализе данных. Знай свой подход Прежде чем приступить к анализу, определите вопросы, на которые вы пытаетесь ответить, и то, что вы пытаетесь понять - не падайте в аналитическую кроличью нору. Кроме того, вы должны знать некоторые основные сведения о ваших источниках данных - какие из них доступны для ответа на вопросы? Как структурированы эти данные? Они содержаться в базе данных? CSV? Или надо подключаться через API? Какие инструменты вы сможете использовать для анализа? Ваш подход, вероятно, изменится, но лучше начать с плана и постепенно уточнять его. Знайте, как были соз...

Jupyter-фишки, которые облегчат жизнь аналитику

Изображение
Если ты работаешь аналитиком или пока еще изучаешь предмет, наверняка, твой основной рабочий инструмент - Jupyter Notebook. И все дело в том, что аналитики используют Python немного по-другому, в отличие от Python-программистов. Конечно, можно делать исследования и в какой-нибудь навороченной IDE, но работа в Jupyter уже давно стала стандартом для аналитиков. А сегодня посмотрим на фишки Jupyter, которые помогут сделать твою работу еще более продуктивной и интересной. Конечно ты знаешь такие pandas команды для обзора датафрейма, как info и describe . Но что, если можно было бы одной командой узнать гораздо больше информации и причем сразу вывести ее в интерактивном  чарте?  Pandas profiling Эта библиотека позволяет выводить расширенную информацию о датафрейме, которую , кстати, можно сохранить в HTML-файл.  Установка Устанавливать Pandas profiling советую не через pip, а через conda. Причем, лучше сразу указывать последнюю версию. Мне по умолчанию conda поставила версию ...