الاستيراد
في هذا الجزء من الكتاب، ستتعلم كيفية استيراد مجموعة أوسع من البيانات إلى R، بالإضافة إلى كيفية تحويلها إلى شكل مفيد للتحليل. في بعض الأحيان يكون الأمر مجرد استدعاء دالة من حزمة استيراد البيانات المناسبة. ولكن في الحالات الأكثر تعقيداً، قد يتطلب الأمر كلاً من التنسيق النظيف (tidying) والتحويل (transformation) من أجل الوصول إلى المستطيل النظيف الذي تفضل العمل معه.
في هذا الجزء من الكتاب ستتعلم كيفية الوصول إلى البيانات المخزنة بالطرق التالية:
في 20 جداول البيانات، ستتعلم كيفية استيراد البيانات من جداول بيانات إكسل Excel وجداول بيانات جوجل (Google Sheets).
في 21 قواعد البيانات، ستتعلم كيفية استخراج البيانات من قاعدة البيانات وإدخالها إلى R (وستتعلم أيضاً القليل عن كيفية نقل البيانات من R إلى قاعدة البيانات).
في 22 Arrow، ستتعلم عن Arrow، وهي أداة قوية للعمل مع البيانات التي تفوق سعة الذاكرة (out-of-memory)، خاصة عندما تكون مخزنة بتنسيق parquet.
في 23 البيانات الهرمية، ستتعلم كيفية العمل مع البيانات الهرمية، بما في ذلك القوائم المتداخلة بعمق والناتجة عن البيانات المخزنة بتنسيق JSON.
في 24 جرف البيانات من الويب، ستتعلم “الكشط” الإلكتروني (web scraping)، وهو فن وعلم استخراج البيانات من صفحات الويب.
هناك حزمتان مهمتان في tidyverse لن نناقشهما هنا: haven و xml2. إذا كنت تعمل مع بيانات من ملفات SPSS و Stata و SAS، فراجع حزمة haven عبر الرابط https://haven.tidyverse.org. وإذا كنت تعمل مع بيانات XML، فراجع حزمة xml2 عبر الرابط https://xml2.r-lib.org. خلاف ذلك، ستحتاج إلى إجراء بعض البحث لمعرفة الحزمة التي ستلزمك لاستخدامها؛ وجوجل هو صديقك هنا 😃.