这篇文章主要为大家展示了“Pandas数据存储的示例分析”,内容简而易懂,条理清晰,希望能够帮助大家解决疑惑,下面让小编带领大家一起研究并学习一下“Pandas数据存储的示例分析”这篇文章吧。
数据的存储
数据可以有两种类型-连续的和离散的,这取决于我们的分析要求。有时我们不需要连续变量中的精确值,但需要它所属的群体。
例如,你的数据中有一个连续变量,年龄。但你需要一个年龄组来进行分析,比如儿童、青少年、成人、老年人。实际上,Binning非常适合解决我们这里的问题。
为了执行Binning,我们使用cut()函数。这对于从连续变量到离散变量非常有用。
import pandas as pddf = pd.read_csv('titanic.csv')from sklearn.utils import shuffle# 随机化df = shuffle(df, random_state = 42)df.head()bins = [0,4,17,65,99]labels =['Toddler','Child','Adult','Elderly']category = pd.cut(df['Age'], bins = bins, labels = labels)df.insert(2, 'Age Group', category)df.head()df['Age Group'].value_counts()df.isnull().sum()
以上是“Pandas数据存储的示例分析”这篇文章的所有内容,感谢各位的阅读!相信大家都有了一定的了解,希望分享的内容对大家有所帮助,如果还想学习更多知识,欢迎关注编程网行业资讯频道!