مقدمة الطبعة الثانية
أهلاً بك في الطبعة الثانية من كتاب “R لعلم البيانات” (R for Data Science)! تعتبر هذه الطبعة إعادة صياغة وهيكلة جذرية للطبعة الأولى؛ فقد أزلنا المحتوى والموضوعات التي لم تعد تخدم القارئ بالشكل الأمثل، وأضفنا موضوعات جديدة كنا نرغب في تضمينها مسبقًا. بالإضافة إلى ذلك، حدّثنا النصوص والأكواد لتعكس التطورات في أفضل الممارسات المتبعة حاليًا. كما يسرنا أن نرحب بمؤلفة مشاركة جديدة في فريق العمل: زميلتنا “ماين تشيتينكايا-رونديل” (Mine Çetinkaya-Rundel)، الأكاديمية والمدرِّسة المتميزة في علم البيانات وأحد زملائنا في شركة Posit (المعروفة سابقًا باسم RStudio).
فيما يلي ملخص لأبرز التغييرات في هذه الطبعة:
تم تغيير اسم الجزء الأول إلى “العملية بأكملها” (Whole game). يهدف هذا الجزء إلى تقديم نظرة شاملة على دورة حياة مشروع علم البيانات قبل الانتقال إلى التفاصيل التقنية للأدوات.
الجزء الثاني هو “تمثيل البيانات بصريًا” (Visualize). يغطي هذا الجزء بشكل أعمق أدوات وأساليب تمثيل البيانات بصريًا مقارنة بالطبعة الأولى. ورغم أن المرجع الأوثق للتفاصيل المتقدمة يبقى كتاب ggplot2، إلا أن هذا الكتاب بات يغطي نطاقًا أوسع من تقنيات وأساليب العرض الفعّال.
الجزء الثالث يحمل الآن اسم “تحويل البيانات” (Transform). أُضيفت فصول جديدة تتناول الأرقام والمتجهات المنطقية (logical vectors) والقيم المفقودة (missing values). كانت هذه المواضيع سابقًا جزءًا من فصل عام في التحويل، لكنها كانت تحتاج إلى مساحة أكبر لشرحها بشكل مفصل وكافٍ.
الجزء الرابع يحمل اسم “استيراد البيانات” (Import). يشمل هذا الجزء فصولًا تتجاوز قراءة الملفات النصية المسطحة إلى التعامل مع جداول البيانات، واستخراج البيانات من قواعد البيانات، والعمل مع البيانات الضخمة (big data)، وتحويل البيانات الهرمية إلى جداول مسطحة (rectangling)، وجمع البيانات من الويب (web scraping).
جزء “البرمجة” (Program) بقي موجودًا، لكنه أُعيد كتابته بالكامل. يركز الآن على العناصر الأساسية لبناء الدوال (functions) والتكرار (iteration). تتضمن فصول كتابة الدوال شرحًا أوسع لكيفية تغليف دوال tidyverse والتعامل مع تحديات التقييم الأنيق (tidy evaluation)، نظرًا لازدياد أهميتها في السنوات الأخيرة. كما أُضيف فصل جديد عن دوال R الأساسية (base R) التي يُحتمل أن تواجهها في بيئات العمل الحقيقية.
تم حذف جزء “النمذجة الإحصائية” (Modeling). لم يكن بالإمكان تغطيته بالشكل المتعمق والموضوعي الذي يستحقه ضمن نطاق هذا الكتاب، كما أن هناك مصادر وإشارات أفضل متاحة حاليًا. لذا نوصي باستخدام حزم tidymodels وقراءة كتاب Tidy Modeling with R من تأليف ماكس كون (Max Kuhn) وجوليا سيلج (Julia Silge).
جزء “التواصل وعرض النتائج” (Communicate) بقي قائماً، لكن جرى تحديثه بالكامل. اعتمد هذا الجزء على نظام Quarto كبديل عن R Markdown. وقد كُتبت هذه الطبعة من الكتاب كاملةً باستخدام Quarto، الذي يُعدّ أداة المستقبل.