© تمامی حقوق این سایت متعلق به رضا خلیلی است.
در این پروژه استخراج داده از وب (Web Scraping)، یک خزشگر وب هوشمند برای وبسایت نمایشگاه بینالمللی Worldfood Moscow طراحی و پیادهسازی شد. هدف اصلی، جمع آوری اطلاعات از سایت نمایشگاه شامل شرکتهای عضو، محصولات نمایشی، اطلاعات تماس و سایر محتوای مرتبط به صورت کاملاً خودکار بود.
در مرحله اول، با تحلیل دقیق ساختار وبسایت و شناسایی APIهای مرتبط، بهترین و بهینهترین روش برای استخراج خودکار داده انتخاب شد. سپس با توسعه اسکریپتهای اختصاصی پایتون، فرآیند وب اسکرپینگ به صورت کامل خودکارسازی گردید. تمامی دادههای استخراجشده پس از پردازش و تمیزسازی، در دو فرمت Excel و JSON ذخیره و به کارفرما تحویل داده شد.
این پروژه نمونهای موفق از داده کاوی وب و استخراج خودکار داده با پایتون است. برای مشاهده کد منبع، به گیتهاب پروژه Worldfood Scraper مراجعه کنید.
© تمامی حقوق این سایت متعلق به رضا خلیلی است.