Handling data and creating visualizations in Hindi
पाइथन प्रोग्रामिंग लैंग्वेज में डेटा हैंडलिंग मैनेजमेंट का अर्थ है, की मल्टीप्ल रिसोर्सेज से डेटा कलेक्ट करना, डाटा को रीड करना, डाटा इन्फो को ऑर्गनाइज़ करना, डाटा क्लियर करना, डाटा मॉडिफाई करना और डाटा एनालिसिस एनालाइज़ करने जैसे स्टेप्स इन्क्लुड होते है। पाइथन में डेटा विज़ुअलाइज़ेशन का मतलब है, अवेलेबल डाटा इनफार्मेशन के साथ ग्राफ़, चार्ट, और प्लॉट का यूज़ करके डेटा इन्फो को ग्रफिकल्ली रिप्रेजेंट किया जा सके, जिससे की डाटा के पैटर्न और ट्रेंड को आसानी से अंडरस्टैंड या एनालाइज किया जा सके।

पाइथन प्रोग्रामिंग में इन टास्क के लिए आपको कई पावरफ़ुल लाइब्रेरी प्रोवाइड करता है, स्पेशली, रूप से अवेलेबल लाइब्रेरी फ्रेमवर्क चॉइस में Pandas, NumPy और Matplotlib, आदि चॉइस है।
Data Handling Concepts in Python.
डेटा एनालिसिस या कलेक्शन के लिए आप डाटा को कई सोर्स से कलेक्ट कर सकते है. जिसमे,
- CSV सपोर्टेड एक्सटेंशन फ़ाइलें
- माइक्रोसॉफ्ट एक्सेल एक्सटेंशन फ़ाइलें
- डेटाबेस सोर्स फाइल्स
- JSON एक्सटेंशन फ़ाइलें
- मल्टीप्ल APIs सोर्सेज डाटा
- मैन्युअल यूज़र इनपुट डाटा
A typical data-handling process in Python is represented as follows.
मल्टीप्ल सोर्सेज से डेटा को कलेक्ट करना
↓
अवेलेबल डेटा सोर्स को पढ़ना
↓
यूज़ डेटा को क्लियर करना
↓
डेटा सोर्स को स्पेसिफिक आर्डर में ऑर्गनाइज़ करना
↓
डेटा को डिटेल में एनालाइज़ करना
↓
डेटा को ग्राफ चार्ट ग्राफिकल फॉर्मेट में विज़ुअलाइज़ करना
Using the Pandas library for data handling tasks in Python.
पाइथन में pandas लाइब्रेरी फ्रेमवर्क टेबल वाले डेटा को हैंडल या मैनेज करने के लिए सबसे अधीक यूज़ होने वाली पाइथन लाइब्रेरी प्लेटफार्म में से एक है।
Python users can import it this way.
import pandas as pd
The Pandas library provides you with two main data structures.
Series pandas data structures.
पाइथन पंडास डाटा टाइप में डेटा वन-डाइमेंशनल ऐरे कलेक्शन फॉर्मेट की तरह स्टोर या रिप्रेजेंट होते है।
values = pd.Series([12, 88, 34, 11, 22, 55, 66])
print(values)
DataFrame pandas data structures.
पाइथन पंडास डाटा टाइप में एक टू-डाइमेंशनल ऐरे की तरह टेबल फॉर्मेट का लेआउट है, जिसमें टेबुलर रो और कॉलम फॉर्मेट में डाटा और इनफार्मेशन स्टोर होते हैं।
import pandas as pd
employee_info = {
“Emp_Name”: [“Rock”, “HHH”, “Cody”, “Austin”],
“Emp_ID”: [109, 101, 103, 110]
}
df = pd.DataFrame(employee_info )
print(df)
The output is.
Emp_Name Emp_ID
0 Rock 109
1 HHH 101
2 Cody 103
3 Austin 110
Reading data from a CSV file in Python.
पाइथन पंडास में CSV का मतलब है, कॉमा-सेपरेटेड वैल्यूज़ फाइल डाटा इन्फो सपोर्टेड एक्सटेंशन है। यहाँ माना की हमारे पास एक employee.csv नाम से फाइल में ये डाटा हैं.
Emp_ID Emp_Name Salary
101 Bhavishi 11000
102 Siddhi 12000
103 Amit 17000
104 Kunal 20000
पाइथन पंडास में हम इसे कुछ इस तरह पढ़ सकते हैं.
import pandas as pd
df = pd.read_csv(“employee.csv”)
print(df)
पाइथन पंडास इस, CSV डेटा फाइल को डेटाफ्रेम में कन्वर्ट करता है।
Examining Data in Python.
पाइथन पंडास में डेटा को लोड करने के बाद, इसके स्ट्रक्चर को अंडरस्टैंड और एनालाइज करना ज़रूरी है।
Show the first row of data.
print(df.head())
Show the last row.
print(df.tail())
Get information about the data table columns.
print(df.info())
Get statistical information.
print(df.describe())
describe() ये वैल्यू दे सकता है.
काउंट
मीन
स्टैंडर्ड डेविएशन
मिनिमम
मैक्सिमम
Selecting data columns in Python Pandas.
To select a single column from the Employee table in Python Pandas.
print(df[“Salary”])
To select multiple columns from the Employee table in Python Pandas.
print(df[[“Emp_Name”, “Salary”]])
Filtering data in Python Pandas.
पाइथन पंडास में टेबल डाटा को फ़िल्टर करने से हम उन टेबल रो को भी सलेक्ट कर सकते हैं, जो एक यूजर डिफाइन कंडीशन को कम्पलीट करती हैं।
उदाहरण के लिए, 10000 से ज़्यादा सैलरी पाने वाले सभी एम्प्लॉई की डिटेल जानने के लिए.
high_Salary = df[df[“Salary”] > 10000]
print(high_Salary)
यह मौजूदा लार्ज डेटासेट से ऊपर में दी गई स्पेसिफिक टेबल डाटा रिकॉर्ड इनफार्मेशन को फाइंड करने के लिए यूज़फुल है।
Sorting Data in Python Pandas.
पाइथन पंडास में टेबल डाटा को sort_values() फंक्शन मेथड का यूज़ करके सॉर्ट या अरेंज किया जा सकता है। जैसे, एम्प्लॉई को उनकी सैलरी के हिसाब से सॉर्ट करना।
df_sorted = df.sort_values(“Salary”, ascending=False)
print(df_sorted)
यहाँ हमें सबसे अधिक सैलरी पाने वाले एम्प्लॉई डाटा इनफार्मेशन पहले डिस्प्ले होगा।
Handling Missing Data in Python Pandas.
पाइथन पंडास में रियल वर्ल्ड के डेटासेट में ज्यादातर मिसिंग वैल्यू डिफाइन होती हैं।
For example.
Emp_Name Salary
Bhavishi 11000
Siddhi 12000
Amit 17000
Kunal 20000
Python users can check for missing values here.
print(df.isnull())
Python users can count missing values here.
print(df.isnull().sum())
Python users can delete missing rows here.
df = df.dropna()
Python users can fill in missing values here.
df[“Salary”] = df[“Salary”].fillna(0)
यहाँ पाइथन में सही स्टेप इस बात पर डिपेंड करता है, इसमें मिसिंग वैल्यू क्या रिप्रेजेंट करती है।
Performing Calculations in Python Pandas.
पाइथन पंडास में अवेलेबल टेबल डाटा कॉलम पर पाइथन यूजर मल्टीप्ल कैलकुलेशन ऑपरेशन को अप्लाई कर सकते हैं।
average = df[“Salary”].mean()
highest = df[“Salary”].max()
lowest = df[“Salary”].min()
print(“The Average Salary Is -“, average)
print(“The Highest Salary Is -“, highest)
print(“The Lowest Salary Is -“, lowest)
The NumPy library can also be used for numerical calculations in Python programming.
NumPy
import numpy as np
Salary = np.array([11000, 12000, 17000, 20000])
print(np.mean(Salary))
print(np.max(Salary))
print(np.min(Salary))
Grouping data in Python Pandas.
पाइथन पंडास में अलग अलग कैटेगरी के अनुसार पर्टिकुलर टेबल या इंडिविजुअल डेटा को ग्रुप किया जा सकता है।
For example.
यहाँ माना की हमारे पास ये एम्प्लॉई डेटाबेस टेबल हैं.
Emp_Name Course Salary
Bhavishi Matlab 11000
Siddhi Ruby 12000
Amit Swift C 17000
Kunal Pearl 20000
Here, we can calculate the average salary by course in this table.
average_salary = df.groupby(“Course”)[“Salary”].mean()
print(average_salary)
यह मौजूदा डाटा में बड़े डेटासेट को एनालाइज़ या एक्स्प्लोर करने में यूज़ किया जाता है।
Creating visualizations in Python using matplotlib.
पाइथन बेस्ड न्यूमेरिक डेटा को हैंडल और एनालाइज़ करने के बाद, यदि आप इस डाटा इन्फो को विज़ुअली ग्राफ या चार्ट फॉर्मेट में रिप्रेजेंट करना चाहते हैं।
पाइथन सपोर्टेड Matplotlib लाइब्रेरी फ्रेमवर्क विज़ुअलाइज़ेशन क्रिएट करने के लिए एक पॉपुलर लाइब्रेरी है।
You can import it into Python as follows.
import matplotlib.pyplot as plt
Line graph with the Python matplotlib library.
पाइथन बेस्ड न्यूमेरिक डेटा को समय के साथ मल्टीप्ल डिफ्रेंस में डिस्प्ले करने के लिए एक लाइन ग्राफ़ का यूज़ किया जाता है।
import matplotlib.pyplot as plt
laptop = [“Macbook Pro”, “Hp Pavilion”, “Acer Swift”, “Asus Tuf”, “DEll”]
sales = [1000, 700, 802, 1200, 600]
plt.plot(laptop, sales, marker=”o”)
plt.xlabel(“Laptop”)
plt.ylabel(“Sales”)
plt.title(“Sales by laptop”)
plt.show()
यहाँ लाइन ग्राफ से हमें यह देखने में हेल्प हो जाती है कि लैपटॉप की बिक्री बढ़ रही है, या घट रही है।
Bar chart with the Python matplotlib library.
पाइथन बेस्ड न्यूमेरिक टेबल डेटा को अलग अलग कैटेगरी की तुलना करने के लिए एक बार चार्ट का यूज़ किया जाता है।
import matplotlib.pyplot as plt
cars = [“Tata Motors”, “Mahindra”, “Hyundai”, “Kia”]
price = [400000, 1000000, 700000, 900000]
plt.bar(cars, price)
plt.xlabel(“cars”)
plt.ylabel(“price”)
plt.title(“price by cars”)
plt.show()
इस प्रोग्राम में हम अलग-अलग कार्स के हिसाब से उसकी प्राइस की जल्दी से तुलना कर सकते हैं।
Histogram chart with the Python matplotlib library.
पाइथन बेस्ड न्यूमेरिक टेबल डेटा को एक हिस्टोग्राम न्यूमेरिकल डेटा का डिस्ट्रीब्यूशन को डिस्प्ले करने में यूज़ किया जा सकता है।
import matplotlib.pyplot as plt
numbers = [10, 17, 22, 29, 36, 50, 50, 57, 64, 71, 88, 85]
plt.hist(numbers, bins=7)
plt.xlabel(“numbers”)
plt.ylabel(“Number of values”)
plt.title(“Spreading of numbers”)
plt.show()
यहाँ इस डाटा के साथ हिस्टोग्राम चार्ट पाइथन यूजर को यह समझने में हेल्पफुल होते हैं कि कोई नंबर वैल्यू को कैसे स्प्रेड या डिस्ट्रिब्यूट की जाती हैं।
Scatter plot chart with the Python matplotlib library.
पाइथन बेस्ड न्यूमेरिक टेबल डेटा को एक स्कैटर प्लॉट में दो न्यूमेरिकल वेरिएबल के बीच के रिलेशन को रिप्रेजेंट करता है।
उदाहरण के लिए, यहाँ हम एम्लॉई टेबल में उनके वर्किंग ऑवर और सैलरी को कैलकुलेट करे.
import matplotlib.pyplot as plt
emp_work_hours = [1, 2, 3, 4, 5, 6, 7, 8]
salary = [10000, 15000, 25000, 30000, 40000, 50000, 60000, 70000]
plt.scatter(emp_work_hours, salary)
plt.xlabel(“Employee emp_work_hours”)
plt.ylabel(“salary”)
plt.title(“Employee emp_work_hours vs. salary”)
plt.show()
पाइथन बेस्ड न्यूमेरिक टेबल डेटा को स्कैटर प्लॉट चार्ट हमें यह पहचानने में हेल्प करता है कि दो अलग वेरिएबल्स के बीच कोई रिलेशन है, या नहीं है।
Pie chart with the Python matplotlib library.
पाइथन बेस्ड न्यूमेरिक टेबल डेटा को एक पाई चार्ट में हर कॉलम एलिमेंट के एक पूरे हिस्से के अनुपात के रूप में ग्राफीकली रिप्रेजेंट करता है।
import matplotlib.pyplot as plt
course = [“CCC”, “O Level”, “A Level”, “B Level”, “C Level”]
enrollment = [1000, 1300, 1100, 300, 200]
plt.pie(
enrollment,
labels=course,
autopct=”%1.1f%%”
)
plt.title(“enrollment by course”)
plt.show()
पाइथन बेस्ड न्यूमेरिक टेबल डेटा में पाई चार्ट तब यूज़ किया जाता हैं, जब आपको मैन टारगेट प्रतिशत या अनुपात में कोई न्यूमेरिक वैल्यू को डिस्प्ले करना हो।
Customizing Manual Graphs Using the Python Matplotlib Library.
पाइथन बेस्ड न्यूमेरिक टेबल डेटा को Matplotlib के माध्यम से हम अपने द्वारा डिज़ाइन ग्राफ़ को मैन्युअल कस्टमाइज़ करने के फीचर्स प्रोवाइड करता है।
import matplotlib.pyplot as plt
gadgets = [“Desktop”, “Laptop”, “Printer”, “Notebook”, “Tablet”]
sales = [700, 1000, 400, 1300, 900]
plt.plot(
gadgets,
sales,
marker=”o”,
linestyle=”-“,
color=”red”,
label=”Sales”
)
plt.xlabel(“Gadgets”)
plt.ylabel(“Sales”)
plt.title(“Gadgets Sales Report”)
plt.legend()
plt.grid(True)
plt.show()
The Python Matplotlib Library contains the necessary functions.
- xlabel() – यह मौजूदा ग्राफ में x-एक्सिस डाटा वैल्यू को लेबल करता है
- ylabel() – यह मौजूदा ग्राफ में y-एक्सिस डाटा वैल्यू को लेबल करता है
- title() – यह मौजूदा ग्राफ में एक टाइटल इन्फो को ऐड करता है
- legend() – यह मौजूदा ग्राफ में लीजेंड लेबल इन्फो को डिस्प्ले करता है
- grid() – यह मौजूदा ग्राफ में ग्रिड लाइन को डिस्प्ले करता है
- show() – यह मौजूदा ग्राफ के शो को डिस्प्ले करता है
Using the Pandas and Matplotlib libraries together in Python.
पाइथन बेस्ड न्यूमेरिक टेबल डेटा को मैनेज या हैंडल करने के लिए Pandas और Matplotlib पाइथन लाइब्रेरी एक साथ बहुत अच्छे से काम करते हैं। माना की यहाँ हमारे पास है.
import pandas as pd
import matplotlib.pyplot as plt
data = {
“Bike_model”: [“Hero Splendor Plus”, “Honda Shine 125”, “Bajaj Pulsar Series”, “TVS Raider 125”, “Honda SP 125”],
“Sales_unit”: [77777, 82000, 92990, 187000, 83910]
}
df = pd.DataFrame(data)
plt.plot(df[“Bike_model”], df[“Sales_unit”], marker=”o”)
plt.xlabel(“Bike_model”)
plt.ylabel(“Sales_unit”)
plt.title(“Bike_model Sales_unit”)
plt.show()
Here in this example.
Pandas पाइथन लाइब्रेरी
↓
Pandas डेटा को स्टोर और हैंडल करता है
↓
Matplotlib पाइथन लाइब्रेरी
↓
एक चार्ट या ग्राफ विज़ुअलाइज़ेशन इमेज को बनाता है
A complete data handling example in Python.
यहाँ हम एक पाइथन बेस्ड डेटाबेस डाटा पर एक एम्प्लॉई डेटासेट को एनालाइज करते है।
import pandas as pd
import matplotlib.pyplot as plt
# Create employee data
data = {
“Emp_Name”: [“Bhavishi”, “Siddhi”, “Shiva”, “Harry”, “Nandish”],
“Salary”: [13000, 10000, 17000, 14000, 9000]
}
# Here we Create a dataframe
df = pd.DataFrame(data)
# Here we Display the data
print(df)
# Here we Calculate the employee average
average = df[“Salary”].mean()
print(“Average Salary is -“, average)
# Here we Find the highest Salary
highest = df[“Salary”].max()
print(“Highest Salary is -“, highest)
# Here we Sort employee by Salary
df = df.sort_values(“Salary”, ascending=False)
print(df)
# Here we Create bars Chart
plt.bar(df[“Emp_Name”], df[“Salary”])
plt.xlabel(“Employee Name”)
plt.ylabel(“Salary Detail”)
plt.title(“Employee Salary”)
plt.show()
This example completes this task process as follows.
एक पाइथन पंडास डेटा बनाएँ
↓
पंडास डेटाफ़्रेम में डाटा को स्टोर करें
↓
अब इस डेटा को एनालाइज़ करें
↓
अवेलेबल डेटा को सॉर्ट करें
↓
matplotlib पाइथन लाइब्रेरी से एक बार चार्ट बनाएँ
Python Matplotlib Based Common Visualization Chart Types
| Chart visualization | Where to use for |
| Line chart graph | Line chart used to display specific trends over time to time in specific industry or culture |
| Bar chart graph | Bar chart used to display comparing categories, values, any product or services |
| Histogram graph | Histogram chart used to display distribution of any specific year sales values or numbers |
| Scatter plot graph | Scatter plotchart used to display relationship between multiple available variables |
| Pie chart graph | Pie chart used to display proportions/percentages of any sales value or individual numbers |
| Box plot graph | Pie chart used to display distribution and outliers numeric based any values or data |
सही विज़ुअलाइज़ेशन चुनना ज़रूरी है क्योंकि अलग-अलग चार्ट अलग-अलग तरह की जानकारी डिस्प्ले करते हैं।
A data handling and visualization workflow concept in Python.
एक बेसिक पाइथन बेस्ड डेटा-एनालिसिस प्रोजेक्ट में इस वर्कफ़्लो को कुछ इस तरह से फ़ॉलो करता है.
रॉ प्रोग्राम डेटा
↓
पाइथन Pandas लाइब्रेरी के साथ इसे पढ़ें
↓
मौजूदा डेटा की जांच करें
↓
अवेलेबल डेटा को साफ़ करें
↓
डेटा को नए में ट्रांसफ़ॉर्म करें
↓
डेटा को एनालाइज़ करें
↓
NumPy/Pandas न्यूमेरिकल कैलकुलेशन को अप्लाई करे
↓
matplotlib पाइथन लाइब्रेरी से एक विज़ुअलाइज़ेशन चार्ट बनाएं
↓
फाइनल आउटपुट रिज़ल्ट को समझें
The importance of data visualization concepts in the Python.
पाइथन में डाटा विज़ुअलाइज़ेशन काम्प्लेक्स डेटा को समझना और एक्सप्लेन करना आसान बनाता है।
For example.
हम एक सेल्स टेबल की कल्पना करते है, जिसमें 12 महीनों की किसी प्रोडक्ट या सर्विसेज की मंथली सेल्स डिफाइन हों.
जनवरी 900
फरवरी 1100
मार्च 700
अप्रैल 1400
मई 1700
…
With this SALES TABLE statement, we can immediately display a graph.
- बढ़ती सेल्स को डिस्प्ले करना
- घटती सेल्स को डिस्प्ले करना
- टोटल ईयर मंथ मे से सबसे ज़्यादा सेल्स वाला महीना
- टोटल ईयर मंथ मे से सबसे कम सेल्स वाला महीना
- टोटल प्रोडक्ट सर्विसेज ट्रेंड्स और असामान्य वैल्यू
इस वजह से, चार्ट डाटा कांसेप्ट विज़ुअलाइज़ेशन मेथड यूज़र्स को टेबल डाटा पैटर्न को पहचानने और उसके रिज़ल्ट्स को इफेक्टिव आर्डर में इंडीकेट करने में हेल्प करता है।
Detailed Comparison Between Python Numpy Vs Pandas Vs Matplotlib Library
| Python library framework | What is purpose with python |
| Numpy python library | Numpy python libraries used to apply all kind of numerical calculations with python pandas matplotlib data or values |
| Pandas python library | Pandas python libraries used to handle or manage python based numeric table data for handling and detailed analysis task |
| Matplotlib python library | Matplotlib python libraries used to create pandas-based data in chart graph format visualization with better user preview for analysis and understanding |
An easy way to remember chart data visualization concepts in Python.
- NumPy → नम्पि में सभी प्रकार के न्यूमेरिक कैलकुलेशन ऑपरेशन को अप्लाई करें
- Pandas → पंडास पाइथन लाइब्रेरी से डाटा इन्फो को ऑर्गनाइज़ और एनालाइज़ करें
- Matplotlib → Matplotlib लाइब्रेरी से पाइथन डाटा को चार्ट में विज़ुअलाइज़ करें
Conclusion of Handling data and creating visualizations.
पाइथन प्रोग्रामिंग लैंग्वेज में डेटा हैंडलिंग मैनेजमेंट डेटा को हैंडल करना और चार्ट ग्राफ जैसे ग्राफिकल विज़ुअलाइज़ेशन क्रिएट करना पाइथन का एक इम्पोर्टेन्ट एलिमेंट या फीचर्स हैं. स्पेशली रूप से डेटा साइंस और काम्प्लेक्स टेबुलर स्ट्रक्चर डाटा एनालिटिक्स या एनालिसिस टास्क में।
Python programming provides powerful tools for this task.
NumPy पाइथन लाइब्रेरी
↓
इससे आप पाइथन डाटा में सभी न्यूमेरिकल कैलकुलेशन को अप्लाई करते है
Pandas पाइथन लाइब्रेरी
↓
यह आपके टेबुलर डेटा इन्फो को हैंडलिंग और एनालिसिस में हेल्प करता है
Matplotlib पाइथन लाइब्रेरी
↓
पाइथन पंडास बेस्ड टेबल डाटा से नया चार्ट ग्राफ विज़ुअलाइज़ेशन बनाने में हेल्प करता है
A common Python project includes NumPy, Pandas, and Matplotlib.
पहले डाटा को पढ़ें → डाटा इन्फो को साफ़ करें → डाटा को एनालाइज़ करें → डाटा को चार्ट ग्राफ में विज़ुअलाइज़ करें → रिजल्ट को इंटरप्रेट करें
पाइथन में Pandas, NumPy और Matplotlib पाइथन लाइब्रेरी को मिलाकर, पाइथन का यूज़ रॉ डेटा को काम की जानकारी और क्लियर विज़ुअल रिपोर्ट में कन्वर्ट डेवलप करने में किया जा सकता है।

