Handling data and creating visualizations In Hindi

Handling data and creating visualizations in Hindi

पाइथन प्रोग्रामिंग लैंग्वेज में डेटा हैंडलिंग मैनेजमेंट का अर्थ है, की मल्टीप्ल रिसोर्सेज से डेटा कलेक्ट करना, डाटा को रीड करना, डाटा इन्फो को ऑर्गनाइज़ करना, डाटा क्लियर करना, डाटा मॉडिफाई करना और डाटा एनालिसिस एनालाइज़ करने जैसे स्टेप्स इन्क्लुड होते है। पाइथन में डेटा विज़ुअलाइज़ेशन का मतलब है, अवेलेबल डाटा इनफार्मेशन के साथ ग्राफ़, चार्ट, और प्लॉट का यूज़ करके डेटा इन्फो को ग्रफिकल्ली रिप्रेजेंट किया जा सके, जिससे की डाटा के पैटर्न और ट्रेंड को आसानी से अंडरस्टैंड या एनालाइज किया जा सके।

Handling data and creating visualizations In Hindi

पाइथन प्रोग्रामिंग में इन टास्क के लिए आपको कई पावरफ़ुल लाइब्रेरी प्रोवाइड करता है, स्पेशली, रूप से अवेलेबल लाइब्रेरी फ्रेमवर्क चॉइस में Pandas, NumPy और Matplotlib, आदि चॉइस है।

Data Handling Concepts in Python.

डेटा एनालिसिस या कलेक्शन के लिए आप डाटा को कई सोर्स से कलेक्ट कर सकते है. जिसमे,

  • CSV सपोर्टेड एक्सटेंशन फ़ाइलें
  • माइक्रोसॉफ्ट एक्सेल एक्सटेंशन फ़ाइलें
  • डेटाबेस सोर्स फाइल्स
  • JSON एक्सटेंशन फ़ाइलें
  • मल्टीप्ल APIs सोर्सेज डाटा
  • मैन्युअल यूज़र इनपुट डाटा

A typical data-handling process in Python is represented as follows.

मल्टीप्ल सोर्सेज से डेटा को कलेक्ट करना

अवेलेबल डेटा सोर्स को पढ़ना

यूज़ डेटा को क्लियर करना

डेटा सोर्स को स्पेसिफिक आर्डर में ऑर्गनाइज़ करना

डेटा को डिटेल में एनालाइज़ करना

डेटा को ग्राफ चार्ट ग्राफिकल फॉर्मेट में विज़ुअलाइज़ करना

Using the Pandas library for data handling tasks in Python.

पाइथन में pandas लाइब्रेरी फ्रेमवर्क टेबल वाले डेटा को हैंडल या मैनेज करने के लिए सबसे अधीक यूज़ होने वाली पाइथन लाइब्रेरी प्लेटफार्म में से एक है।

Python users can import it this way.

import pandas as pd

The Pandas library provides you with two main data structures.

Series pandas data structures.

पाइथन पंडास डाटा टाइप में डेटा वन-डाइमेंशनल ऐरे कलेक्शन फॉर्मेट की तरह स्टोर या रिप्रेजेंट होते है।

values = pd.Series([12, 88, 34, 11, 22, 55, 66])

print(values)

DataFrame pandas data structures.

पाइथन पंडास डाटा टाइप में एक टू-डाइमेंशनल ऐरे की तरह टेबल फॉर्मेट का लेआउट है,  जिसमें टेबुलर रो और कॉलम फॉर्मेट में डाटा और इनफार्मेशन स्टोर होते हैं।

import pandas as pd

employee_info = {

    “Emp_Name”: [“Rock”, “HHH”, “Cody”, “Austin”],

    “Emp_ID”: [109, 101, 103, 110]

}

df = pd.DataFrame(employee_info )

print(df)

The output is.

 Emp_Name  Emp_ID

0     Rock     109

1      HHH     101

2     Cody     103

3   Austin     110

Reading data from a CSV file in Python.

पाइथन पंडास में CSV का मतलब है, कॉमा-सेपरेटेड वैल्यूज़ फाइल डाटा इन्फो सपोर्टेड एक्सटेंशन है। यहाँ माना की हमारे पास एक employee.csv नाम से फाइल में ये डाटा हैं.

Emp_ID Emp_Name Salary

101        Bhavishi         11000

102        Siddhi             12000

103        Amit                17000

104        Kunal              20000

पाइथन पंडास में हम इसे कुछ इस तरह पढ़ सकते हैं.

import pandas as pd

df = pd.read_csv(“employee.csv”)

print(df)

पाइथन पंडास इस, CSV डेटा फाइल को डेटाफ्रेम में कन्वर्ट करता है।

Examining Data in Python.

पाइथन पंडास में डेटा को लोड करने के बाद, इसके स्ट्रक्चर को अंडरस्टैंड और एनालाइज करना ज़रूरी है।

Show the first row of data.

print(df.head())

Show the last row.

print(df.tail())

Get information about the data table columns.

print(df.info())

Get statistical information.

print(df.describe())

describe() ये वैल्यू दे सकता है.

काउंट

मीन

स्टैंडर्ड डेविएशन

मिनिमम

मैक्सिमम

Selecting data columns in Python Pandas.

To select a single column from the Employee table in Python Pandas.

print(df[“Salary”])

To select multiple columns from the Employee table in Python Pandas.

print(df[[“Emp_Name”, “Salary”]])

Filtering data in Python Pandas.

पाइथन पंडास में टेबल डाटा को फ़िल्टर करने से हम उन टेबल रो को भी सलेक्ट कर सकते हैं, जो एक यूजर डिफाइन कंडीशन को कम्पलीट करती हैं।

उदाहरण के लिए, 10000 से ज़्यादा सैलरी पाने वाले सभी एम्प्लॉई की डिटेल जानने के लिए.

high_Salary = df[df[“Salary”] > 10000]

print(high_Salary)

यह मौजूदा लार्ज डेटासेट से ऊपर में दी गई स्पेसिफिक टेबल डाटा रिकॉर्ड इनफार्मेशन को फाइंड करने के लिए यूज़फुल है।

Sorting Data in Python Pandas.

पाइथन पंडास में टेबल डाटा को sort_values() फंक्शन मेथड का यूज़ करके सॉर्ट या अरेंज किया जा सकता है। जैसे, एम्प्लॉई को उनकी सैलरी के हिसाब से सॉर्ट करना।

df_sorted = df.sort_values(“Salary”, ascending=False)

print(df_sorted)

यहाँ हमें सबसे अधिक सैलरी पाने वाले एम्प्लॉई डाटा इनफार्मेशन पहले डिस्प्ले होगा।

Handling Missing Data in Python Pandas.

पाइथन पंडास में रियल वर्ल्ड के डेटासेट में ज्यादातर मिसिंग वैल्यू डिफाइन होती हैं।

For example.

Emp_Name Salary

Bhavishi         11000

Siddhi             12000

Amit                17000

Kunal              20000

Python users can check for missing values ​​here.

print(df.isnull())

Python users can count missing values ​​here.

print(df.isnull().sum())

Python users can delete missing rows here.

df = df.dropna()

Python users can fill in missing values ​​here.

df[“Salary”] = df[“Salary”].fillna(0)

यहाँ पाइथन में सही स्टेप इस बात पर डिपेंड करता है, इसमें मिसिंग वैल्यू क्या रिप्रेजेंट करती है।

Performing Calculations in Python Pandas.

पाइथन पंडास में अवेलेबल टेबल डाटा कॉलम पर पाइथन यूजर मल्टीप्ल कैलकुलेशन ऑपरेशन को अप्लाई कर सकते हैं।

average = df[“Salary”].mean()

highest = df[“Salary”].max()

lowest = df[“Salary”].min()

print(“The Average Salary Is -“, average)

print(“The Highest Salary Is -“, highest)

print(“The Lowest Salary Is -“, lowest)

The NumPy library can also be used for numerical calculations in Python programming.

NumPy

import numpy as np

Salary = np.array([11000, 12000, 17000, 20000])

print(np.mean(Salary))

print(np.max(Salary))

print(np.min(Salary))

Grouping data in Python Pandas.

पाइथन पंडास में अलग अलग कैटेगरी के अनुसार पर्टिकुलर टेबल या इंडिविजुअल डेटा को ग्रुप किया जा सकता है।

For example.

यहाँ माना की हमारे पास ये एम्प्लॉई डेटाबेस टेबल हैं.

Emp_Name Course Salary

Bhavishi         Matlab 11000

Siddhi             Ruby      12000

Amit                Swift C 17000

Kunal              Pearl      20000

Here, we can calculate the average salary by course in this table.

average_salary = df.groupby(“Course”)[“Salary”].mean()

print(average_salary)

यह मौजूदा डाटा में बड़े डेटासेट को एनालाइज़ या एक्स्प्लोर करने में यूज़ किया जाता है।

Creating visualizations in Python using matplotlib.

पाइथन बेस्ड न्यूमेरिक डेटा को हैंडल और एनालाइज़ करने के बाद, यदि आप इस डाटा इन्फो को विज़ुअली ग्राफ या चार्ट फॉर्मेट में रिप्रेजेंट करना चाहते हैं।

पाइथन सपोर्टेड Matplotlib लाइब्रेरी फ्रेमवर्क विज़ुअलाइज़ेशन क्रिएट करने के लिए एक पॉपुलर लाइब्रेरी है।

You can import it into Python as follows.

import matplotlib.pyplot as plt

Line graph with the Python matplotlib library.

पाइथन बेस्ड न्यूमेरिक डेटा को समय के साथ मल्टीप्ल डिफ्रेंस में डिस्प्ले करने के लिए एक लाइन ग्राफ़ का यूज़ किया जाता है।

import matplotlib.pyplot as plt

laptop = [“Macbook Pro”, “Hp Pavilion”, “Acer Swift”, “Asus Tuf”, “DEll”]

sales = [1000, 700, 802, 1200, 600]

plt.plot(laptop, sales, marker=”o”)

plt.xlabel(“Laptop”)

plt.ylabel(“Sales”)

plt.title(“Sales by laptop”)

plt.show()

यहाँ लाइन ग्राफ से हमें यह देखने में हेल्प हो जाती है कि लैपटॉप की बिक्री बढ़ रही है, या घट रही है।

Bar chart with the Python matplotlib library.

पाइथन बेस्ड न्यूमेरिक टेबल डेटा को अलग अलग कैटेगरी की तुलना करने के लिए एक बार चार्ट का यूज़ किया जाता है।

import matplotlib.pyplot as plt

cars = [“Tata Motors”, “Mahindra”, “Hyundai”, “Kia”]

price = [400000, 1000000, 700000, 900000]

plt.bar(cars, price)

plt.xlabel(“cars”)

plt.ylabel(“price”)

plt.title(“price by cars”)

plt.show()

इस प्रोग्राम में हम अलग-अलग कार्स के हिसाब से उसकी प्राइस की जल्दी से तुलना कर सकते हैं।

Histogram chart with the Python matplotlib library.

पाइथन बेस्ड न्यूमेरिक टेबल डेटा को एक हिस्टोग्राम न्यूमेरिकल डेटा का डिस्ट्रीब्यूशन को डिस्प्ले करने में यूज़ किया जा सकता है।

import matplotlib.pyplot as plt

numbers = [10, 17, 22, 29, 36, 50, 50, 57, 64, 71, 88, 85]

plt.hist(numbers, bins=7)

plt.xlabel(“numbers”)

plt.ylabel(“Number of values”)

plt.title(“Spreading of numbers”)

plt.show()

यहाँ इस डाटा के साथ हिस्टोग्राम चार्ट पाइथन यूजर को यह समझने में हेल्पफुल होते हैं कि कोई नंबर वैल्यू को कैसे स्प्रेड या डिस्ट्रिब्यूट की जाती हैं।

Scatter plot chart with the Python matplotlib library.

पाइथन बेस्ड न्यूमेरिक टेबल डेटा को एक स्कैटर प्लॉट में दो न्यूमेरिकल वेरिएबल के बीच के रिलेशन को रिप्रेजेंट करता है।

उदाहरण के लिए, यहाँ हम एम्लॉई टेबल में उनके वर्किंग ऑवर और सैलरी को कैलकुलेट करे.

import matplotlib.pyplot as plt

emp_work_hours = [1, 2, 3, 4, 5, 6, 7, 8]

salary = [10000, 15000, 25000, 30000, 40000, 50000, 60000, 70000]

plt.scatter(emp_work_hours, salary)

plt.xlabel(“Employee emp_work_hours”)

plt.ylabel(“salary”)

plt.title(“Employee emp_work_hours vs. salary”)

plt.show()

पाइथन बेस्ड न्यूमेरिक टेबल डेटा को स्कैटर प्लॉट चार्ट हमें यह पहचानने में हेल्प करता है कि दो अलग वेरिएबल्स के बीच कोई रिलेशन है, या नहीं है।

Pie chart with the Python matplotlib library.

पाइथन बेस्ड न्यूमेरिक टेबल डेटा को एक पाई चार्ट में हर कॉलम एलिमेंट के एक पूरे हिस्से के अनुपात के रूप में ग्राफीकली रिप्रेजेंट करता है।

 import matplotlib.pyplot as plt

course = [“CCC”, “O Level”, “A Level”, “B Level”, “C Level”]

enrollment = [1000, 1300, 1100, 300, 200]

plt.pie(

    enrollment,

labels=course,

autopct=”%1.1f%%”

)

plt.title(“enrollment by course”)

plt.show()

पाइथन बेस्ड न्यूमेरिक टेबल डेटा में पाई चार्ट तब यूज़ किया जाता हैं, जब आपको मैन टारगेट प्रतिशत या अनुपात में कोई न्यूमेरिक वैल्यू को डिस्प्ले करना हो।

Customizing Manual Graphs Using the Python Matplotlib Library.

पाइथन बेस्ड न्यूमेरिक टेबल डेटा को Matplotlib के माध्यम से हम अपने द्वारा डिज़ाइन ग्राफ़ को मैन्युअल कस्टमाइज़ करने के फीचर्स प्रोवाइड करता है।

import matplotlib.pyplot as plt

gadgets = [“Desktop”, “Laptop”, “Printer”, “Notebook”, “Tablet”]

sales = [700, 1000, 400, 1300, 900]

plt.plot(

    gadgets,

    sales,

    marker=”o”,

    linestyle=”-“,

    color=”red”,

    label=”Sales”

)

plt.xlabel(“Gadgets”)

plt.ylabel(“Sales”)

plt.title(“Gadgets Sales Report”)

plt.legend()

plt.grid(True)

plt.show()

The Python Matplotlib Library contains the necessary functions.

  • xlabel() – यह मौजूदा ग्राफ में x-एक्सिस डाटा वैल्यू को लेबल करता है
  • ylabel() – यह मौजूदा ग्राफ में y-एक्सिस डाटा वैल्यू को लेबल करता है
  • title() – यह मौजूदा ग्राफ में एक टाइटल इन्फो को ऐड करता है
  • legend() – यह मौजूदा ग्राफ में लीजेंड लेबल इन्फो को डिस्प्ले करता है
  • grid() – यह मौजूदा ग्राफ में ग्रिड लाइन को डिस्प्ले करता है
  • show() – यह मौजूदा ग्राफ के शो को डिस्प्ले करता है

Using the Pandas and Matplotlib libraries together in Python.

पाइथन बेस्ड न्यूमेरिक टेबल डेटा को मैनेज या हैंडल करने के लिए Pandas और Matplotlib पाइथन लाइब्रेरी एक साथ बहुत अच्छे से काम करते हैं। माना की यहाँ हमारे पास है.

import pandas as pd

import matplotlib.pyplot as plt

data = {

“Bike_model”: [“Hero Splendor Plus”, “Honda Shine 125”, “Bajaj Pulsar Series”, “TVS Raider 125”, “Honda SP 125”],

“Sales_unit”: [77777, 82000, 92990, 187000, 83910]

}

df = pd.DataFrame(data)

plt.plot(df[“Bike_model”], df[“Sales_unit”], marker=”o”)

plt.xlabel(“Bike_model”)

plt.ylabel(“Sales_unit”)

plt.title(“Bike_model Sales_unit”)

plt.show()

Here in this example.

Pandas पाइथन लाइब्रेरी

Pandas डेटा को स्टोर और हैंडल करता है

Matplotlib पाइथन लाइब्रेरी

एक चार्ट या ग्राफ विज़ुअलाइज़ेशन इमेज को बनाता है

A complete data handling example in Python.

यहाँ हम एक पाइथन बेस्ड डेटाबेस डाटा पर एक एम्प्लॉई डेटासेट को एनालाइज करते है।

import pandas as pd

import matplotlib.pyplot as plt

# Create employee data

data = {

“Emp_Name”: [“Bhavishi”, “Siddhi”, “Shiva”, “Harry”, “Nandish”],

“Salary”: [13000, 10000, 17000, 14000, 9000]

}

# Here we Create a dataframe

df = pd.DataFrame(data)

# Here we Display the data

print(df)

# Here we Calculate the employee average

average = df[“Salary”].mean()

print(“Average Salary is -“, average)

# Here we Find the highest Salary

highest = df[“Salary”].max()

print(“Highest Salary is -“, highest)

# Here we Sort employee by Salary

df = df.sort_values(“Salary”, ascending=False)

print(df)

# Here we Create bars Chart

plt.bar(df[“Emp_Name”], df[“Salary”])

plt.xlabel(“Employee Name”)

plt.ylabel(“Salary Detail”)

plt.title(“Employee Salary”)

plt.show()

This example completes this task process as follows.

एक पाइथन पंडास डेटा बनाएँ

पंडास डेटाफ़्रेम में डाटा को स्टोर करें

अब इस डेटा को एनालाइज़ करें

अवेलेबल डेटा को सॉर्ट करें

matplotlib पाइथन लाइब्रेरी से एक बार चार्ट बनाएँ

Python Matplotlib Based Common Visualization Chart Types

Chart visualizationWhere to use for
Line chart graphLine chart used to display specific trends over time to time in specific industry or culture
Bar chart graphBar chart used to display comparing categories, values, any product or services
Histogram graphHistogram chart used to display distribution of any specific year sales values or numbers
Scatter plot graphScatter plotchart used to display relationship between multiple available variables
Pie chart graphPie chart used to display proportions/percentages of any sales value or individual numbers
Box plot graphPie chart used to display distribution and outliers numeric based any values or data

सही विज़ुअलाइज़ेशन चुनना ज़रूरी है क्योंकि अलग-अलग चार्ट अलग-अलग तरह की जानकारी डिस्प्ले करते हैं।

A data handling and visualization workflow concept in Python.

एक बेसिक पाइथन बेस्ड डेटा-एनालिसिस प्रोजेक्ट में इस वर्कफ़्लो को कुछ इस तरह से फ़ॉलो करता है.

रॉ प्रोग्राम डेटा

पाइथन Pandas लाइब्रेरी के साथ इसे पढ़ें

मौजूदा डेटा की जांच करें

अवेलेबल डेटा को साफ़ करें

डेटा को नए में ट्रांसफ़ॉर्म करें

डेटा को एनालाइज़ करें

NumPy/Pandas न्यूमेरिकल कैलकुलेशन को अप्लाई करे

matplotlib पाइथन लाइब्रेरी से एक विज़ुअलाइज़ेशन चार्ट बनाएं

फाइनल आउटपुट रिज़ल्ट को समझें

The importance of data visualization concepts in the Python.

पाइथन में डाटा विज़ुअलाइज़ेशन काम्प्लेक्स डेटा को समझना और एक्सप्लेन करना आसान बनाता है।

For example.

हम एक सेल्स टेबल की कल्पना करते है, जिसमें 12 महीनों की किसी प्रोडक्ट या सर्विसेज की मंथली सेल्स डिफाइन हों.

जनवरी 900

फरवरी 1100

मार्च 700

अप्रैल 1400

मई 1700

With this SALES TABLE statement, we can immediately display a graph.

  • बढ़ती सेल्स को डिस्प्ले करना
  • घटती सेल्स को डिस्प्ले करना
  • टोटल ईयर मंथ मे से सबसे ज़्यादा सेल्स वाला महीना
  • टोटल ईयर मंथ मे से सबसे कम सेल्स वाला महीना
  • टोटल प्रोडक्ट सर्विसेज ट्रेंड्स और असामान्य वैल्यू

इस वजह से, चार्ट डाटा कांसेप्ट विज़ुअलाइज़ेशन मेथड यूज़र्स को टेबल डाटा पैटर्न को पहचानने और उसके रिज़ल्ट्स को इफेक्टिव आर्डर में इंडीकेट करने में हेल्प करता है।

Detailed Comparison Between Python Numpy Vs Pandas Vs Matplotlib Library

Python library frameworkWhat is purpose with python
Numpy python libraryNumpy python libraries used to apply all kind of numerical calculations with python pandas matplotlib data or values
Pandas python libraryPandas python libraries used to handle or manage python based numeric table data for handling and detailed analysis task
Matplotlib python libraryMatplotlib python libraries used to create pandas-based data in chart graph format visualization with better user preview for analysis and understanding

An easy way to remember chart data visualization concepts in Python.

  • NumPy → नम्पि में सभी प्रकार के न्यूमेरिक कैलकुलेशन ऑपरेशन को अप्लाई करें
  • Pandas → पंडास पाइथन लाइब्रेरी से डाटा इन्फो को ऑर्गनाइज़ और एनालाइज़ करें
  • Matplotlib → Matplotlib लाइब्रेरी से पाइथन डाटा को चार्ट में विज़ुअलाइज़ करें

Conclusion of Handling data and creating visualizations.

पाइथन प्रोग्रामिंग लैंग्वेज में डेटा हैंडलिंग मैनेजमेंट डेटा को हैंडल करना और चार्ट ग्राफ जैसे ग्राफिकल विज़ुअलाइज़ेशन क्रिएट करना पाइथन का एक इम्पोर्टेन्ट एलिमेंट या फीचर्स हैं. स्पेशली रूप से डेटा साइंस और काम्प्लेक्स टेबुलर स्ट्रक्चर डाटा एनालिटिक्स या एनालिसिस टास्क में।

Python programming provides powerful tools for this task.

NumPy पाइथन लाइब्रेरी

इससे आप पाइथन डाटा में सभी न्यूमेरिकल कैलकुलेशन को अप्लाई करते है

Pandas पाइथन लाइब्रेरी

यह आपके टेबुलर डेटा इन्फो को हैंडलिंग और एनालिसिस में हेल्प करता है

Matplotlib पाइथन लाइब्रेरी

पाइथन पंडास बेस्ड टेबल डाटा से नया चार्ट ग्राफ विज़ुअलाइज़ेशन बनाने में हेल्प करता है

A common Python project includes NumPy, Pandas, and Matplotlib.

पहले डाटा को पढ़ें → डाटा इन्फो को साफ़ करें → डाटा को एनालाइज़ करें → डाटा को चार्ट ग्राफ में विज़ुअलाइज़ करें → रिजल्ट को इंटरप्रेट करें

पाइथन में Pandas, NumPy और Matplotlib पाइथन लाइब्रेरी को मिलाकर, पाइथन का यूज़ रॉ डेटा को काम की जानकारी और क्लियर विज़ुअल रिपोर्ट में कन्वर्ट डेवलप करने में किया जा सकता है।

Leave a Reply