Способ 1: кнопка на сайте
Войдите в аккаунт
Без входа скачивание недоступно.
Откройте страницу датасета
Например, через поиск в разделе Datasets.
Нажмите Download
Архив ZIP со всеми файлами скачается на компьютер. Отдельный файл можно скачать из блока Data Explorer.
Для данных соревнования
Сначала Join Competition и принятие правил, затем вкладка Data → Download All.
Способ 2: утилита kaggle в терминале
Удобно для больших наборов и серверов. Установите утилиту командой pip install kaggle. Затем получите токен: в профиле Settings → API → Create New Token. Скачается файл kaggle.json — положите его в папку .kaggle в домашнем каталоге (на Windows это C:\Users\<имя>\.kaggle\kaggle.json) или задайте переменную окружения KAGGLE_API_TOKEN.
Скачать датасет: kaggle datasets download -d владелец/название. Данные соревнования: kaggle competitions download -c название. Адрес «владелец/название» берётся из URL страницы датасета после kaggle.com/datasets/.
Способ 3: kagglehub в Python
Самый короткий путь, если данные нужны сразу в коде или в Colab. Установка: pip install kagglehub. Дальше две строки: import kagglehub и path = kagglehub.dataset_download('владелец/название'). Функция вернёт путь к папке с файлами.
Можно скачать конкретную версию ('владелец/название/versions/1'), один файл (параметр path='data.csv') или в свою папку (output_dir). Авторизация — через kagglehub.login(), переменную KAGGLE_API_TOKEN, файл kaggle.json или секрет KAGGLE_API_TOKEN в Colab.
Если не скачивается
- Ошибка 401 — токен не найден или устарел. Создайте новый в Settings → API и замените файл.
- Ошибка 403 на данных соревнования — вы не приняли правила. Нажмите Join Competition на сайте.
- Внутри ноутбука Kaggle скачивать не нужно: подключите датасет кнопкой Add Input, файлы появятся в /kaggle/input.
- Перед использованием в продукте проверьте лицензию датасета на его странице — об этом отдельная страница «Датасеты» на сайте.
Что делать после скачивания
Архив с Kaggle обычно содержит CSV или Parquet и иногда папки с картинками. Перед обучением откройте описание датасета: там объяснены колонки и указано, есть ли разбиение на обучающую и тестовую части. Загрузите данные в pandas и сразу посмотрите размер, типы колонок, пропуски и дубли.
Большие датасеты удобнее не скачивать целиком, а работать с ними в ноутбуке Kaggle, где данные уже подключены, или скачать только нужный файл через kagglehub с параметром path. Для Parquet используйте pandas.read_parquet — это быстрее и компактнее CSV.
Если датасет обновляется, фиксируйте версию: kagglehub умеет скачивать конкретную версию по адресу с /versions/номер. Так эксперимент можно будет повторить через полгода с теми же данными, даже если автор набор переделает.
Когда быстрее через ИИ-агента
ИИ-агент LeanTech напишет код скачивания и загрузки под ваш датасет, разберёт его структуру, почистит пропуски и дубли и отдаст готовый CSV с описанием колонок. Если своих данных нет, подскажет, какие открытые наборы подходят под задачу.
Агент не входит в ваш аккаунт Kaggle и не принимает правила соревнований за вас: токен и согласие с правилами — только ваши.