Проект представляет собой парсер документации Python PEP (Python Enhancement Proposals) с оффициальной страницы языка.
- Язык программирования: Python 3.9
- Фреймворк для веб-парсинга: Scrapy
Scrapy - это мощный фреймворк для извлечения данных из веб-сайтов. Он предоставляет удобный интерфейс для создания веб-пауков (спайдеров), которые позволяют автоматизировать процесс сбора информации с веб-страниц. Scrapy поддерживает различные методы для выбора данных, обхода страниц, обработки данных и сохранения результатов.
Для работы вам необходимо клонировать репозиторий проекта и установить зависимости из файла requirements.txt:
git clone
cd scrapy_parser_pep
pip install -r requirements.txt
Для запуска необходимо выполнить следующую команду:
scrapy crawl pep
Здесь pep - это название спайдера, который содержит логику для обхода страниц и извлечения данных о PEP.
После успешного выполнения, парсер соберет информацию и сохранит ее в файл pep_%(time)s.csv и status_summary_%(time)s.csv.
Файл pep.csv содержит информацию о существующих PEP:
- номер PEP.
- название PEP.
- статус PEP (например, Accepted, Rejected, Final, Draft и т.д.).
Файл status_summary.csv содержит сводную информацию о количестве PEP в каждом из существующих статусов и общее количество PEP:
- статус PEP.
- количество PEP с данным статусом.
- общее количество PEP.