pytorch深度学习-excle文件读取-洪萨配资

深度学习有了网络，还得加载进来，读取进来。
常用地方法就是用pandas包
比如我们有个excel文件，名叫"test.xlsx"
文件中我们随便输入一些数：

1 2 3 4 5 6 7 8 9 10 11 12

然后我们用panda包进行读取并且打出来

import pandas as pd data = pd.read_excel('test.xlsx') print(data)

但是打印出来的结果如下：

1 2 3 4 0 5 6 7 8 1 9 10 11 12

可以发现这是一件很奇怪的事情，最左侧对每一行进行了标注序号，从0开始，并且它默认将第一行数据当作了表头，或者说列名。这是因为，pd.read_excel有一个默认的参数"header=0"，0表示第1行，我们可以发现python数据逻辑中的索引都是从0开始的。
为了不让它将第一行作为表的列名，我们可以在读取数据的时候，传给它参数：

import pandas as pd data = pd.read_excel('test.xlsx',header=None) print(data)

打印出的结果：

0 1 2 3 0 1 2 3 4 1 5 6 7 8 2 9 10 11 12

它自动给每一行每一列都添加了索引。

如何查看数据信息

首先我们可以打印出这个数据的大小：

print(data.shape)

也就是（3，4），表示数据是一个3行4列的矩阵。

print(data.info())会打印DataFrame的详细信息。
比如我重新读取一个excel文件，并且打印它的详细信息：

读取excel数据已经完成！ <class 'pandas.core.frame.DataFrame'> RangeIndex: 1500 entries, 0 to 1499 Columns: 800 entries, 0 to 799 dtypes: float64(800) memory usage: 9.2 MB None

它告诉我们有1500，800列，dtypes64（800）说明这800列数据，都是64位浮点型。
我们可以算一下，1个64位的浮点数需要占用64bit，即64/8=8Byte，1500X800个浮点数就需要占用1500X800X8=9.610^6Byte。
也就是9.610^6/1024=9375KB，也就是9375/1024=9.15527 MB≈\approx≈9.2MB。

print(data.describe())打印出的信息是数据的摘要，每一列数据

0 1 ... 798 799 count 1500.000000 1500.000000 ... 1500.000000 1500.000000 mean 1.372601 1.372463 ... 4.958753 4.968210 std 0.685117 0.671365 ... 3.926098 3.953220 min 0.036198 0.031655 ... 0.036077 0.093626 25% 0.854522 0.866613 ... 1.217818 1.179935 50% 1.311026 1.306155 ... 2.404762 2.327359 75% 1.805137 1.796843 ... 8.893706 8.957338 max 4.146413 4.711889 ... 11.713591 12.103350 [8 rows x 800 columns]

它给出了每一列数据的统计信息

如何在读取后取出来索引某些数据

我觉得，pandas的逻辑还是以列为单位保存数据的，因为它会统计每一列的数据的统计信息。
如果要取第i列，那么可以用data[i-1]，比如第1列，就是data[0]。每一列都是Series数据类型：

firstCol = data[0] #取第一列 print(f"firstCol的数据类型：{type(firstCol)}") print(f"data的数据类型：{type(data)}")

最终打印信息如下：
firstCol的数据类型：<class ‘pandas.core.series.Series’>
data的数据类型：<class ‘pandas.core.frame.DataFrame’>

有一种更好操作的方法：
data.iloc[0,:]表示取出来第1行，
data.iloc[:,0]表示取出来第1列
data.iloc[0,0]表示取出来第1行第1列。

.iloc表示按位置提取，这和matab的操作很像。

API文档生成器：Swagger集成提升Fun-ASR服务易用性

API文档生成器：Swagger集成提升Fun-ASR服务易用性在企业级AI应用日益普及的今天，一个语音识别系统是否“好用”，早已不再仅仅取决于模型精度。真正的挑战往往出现在落地环节：当开发团队需要将ASR能力嵌入工单系统、会议平台或智能…

李华

Python代码语音编写：用自然语言描述生成对应脚本片段

Python代码语音编写：用自然语言描述生成对应脚本片段在程序员熬夜写代码的深夜，有没有一种方式能让双手从键盘上解放出来，只靠“说话”就能完成一段函数的编写？这听起来像是科幻电影里的桥段，但随着语音识别与大语言模…

李华

DEV.to技术博客投稿：面向程序员群体传播开源精神

Fun-ASR WebUI：当大模型遇上图形化界面，语音识别还能这么简单？ 在智能时代，语音正在成为人机交互的核心入口之一。从会议纪要自动生成到教学视频字幕制作，从客服质检到内容创作辅助，高质量的语音转文字能力…

李华

语音识别Benchmark测试：Fun-ASR在Aishell等数据集表现

语音识别Benchmark测试：Fun-ASR在Aishell等数据集表现在智能办公、远程会议和语音助手日益普及的今天，如何将一段嘈杂的录音准确转写成结构清晰的文字，已成为企业和开发者关注的核心问题。尤其是在中文场景下，数字表达多样、专业…

李华

如何利用热词提升Fun-ASR对专业术语的识别准确率？

如何利用热词提升Fun-ASR对专业术语的识别准确率？ 在智能客服录音转写、会议纪要生成或景区语音导览分析中，你是否遇到过这样的尴尬：系统把“营业时间”听成了“开始时间”，把“客服电话”误识为“课服电话”？这些看似…

李华

语音识别结果导出CSV/JSON：方便后续数据分析与存档

语音识别结果导出CSV/JSON：打通数据流转的“最后一公里” 在企业日益依赖语音数据进行决策的今天，仅仅“听懂”声音已经远远不够。会议室里的讨论、客服电话中的反馈、访谈录音里的观点——这些声音背后的信息若不能高效转化为可分析、可追溯、可集成的…

李华