50行Python代码获取高考志愿信息

发布时间：2021-04-28 10:59:17 所属栏目：外闻来源：互联网

导读：成了不少的麻烦。不过仔细分析之后，其实问题也并不难。首先要提取的是学校名字，可以看到学校名字和其他文字混在一起，例如本科一批普通文科627集美大学报考情况。本来我准备用正则表达式提取，然后发现用正则表达式好像很难。之后我多访问了几个网页，发

成了不少的麻烦。不过仔细分析之后，其实问题也并不难。

首先要提取的是学校名字，可以看到学校名字和其他文字混在一起，例如"本科一批普通文科627集美大学报考情况"。本来我准备用正则表达式提取，然后发现用正则表达式好像很难。之后我多访问了几个网页，发现学校代码基本上都是数字，如果有字母的话也出现到第一位，所以我采用了以下的算法，首先将字符串从数字处分隔，右边的一个部分就包含了学校名字和“报考情况”几个字，然后删除“报考情况”即可得到学校名字。这个算法唯一的缺点就是，假如出现了字母在中间的代号，就没办法获取到学校名字了，不过实际运行之后，我幸运的发现并没有出现这种情况。

之后要提取的就是专业信息了，在网页源代码中这部分使用tr和td标签来呈现的。一开始我用的是tr加上选择器来提取，但是这个网页生成的时候很有问题，每个tr标签的样式居然还根据内容的多少而不同，导致我写死的选择器没法完美获取所有行。不过后来我发现整个网页内容都是一个表格，除去表头和结尾的几个固定行之外，剩下的恰好就是要提取的数据行，所以直接获取tr标签，然后切片除去收尾即可。页基本上分析完了，下面就是编写代码了。

编写代码

总共50行左右代码，我添加了注释，相信大家应该很容易就可以看懂。

第一部分代码是从网址表格读取所有url，一开始编写的时候，表格里的url是从另一个公式生成的，所以需要在加载的时候添加data_only=True才能读取到公式的结果，否则只能读取到公式本身。

第二部分是创建输出文件，然后编写表头。顺带为了调试方便，我让它如果检测到已经存在目标文件的话就删掉，在建立一个新的。

第三部分就是代码的核心了。Python代码看着可能有点奇怪，不过对照上面的分析，我想大家应该很容易看懂。需要注意保存文件在最后，假如半路代码出现异常，整个就白干了，而一千七百多条网址不可能保证都正常运行。由于输出格式是“学校名+专业信息”这样的格式，所以我获取学校名之后，还要将学校插入到每行专业信息之前。所以我这里索性直接用try-except包起来，如果出错的话只打印一下出错的网址。

（编辑：应用网_丽江站长网）

【声明】本站内容均来自网络，其相关言论仅代表作者个人观点，不代表本站立场。若无意侵犯到您的权利，请及时与联系站长删除相关内容!

Google更新搜索引擎核	巴基斯坦苏吉吉纳里水
Shopee与Lazada 东南亚	尼罗河泛滥节，埃及人