python - 在 python 中从网络（带有重定向）下载 .csv 文件

Question

首先让我说，我知道有一些主题讨论与我类似的问题，但由于某种原因，建议的解决方案似乎对我不起作用。另外，我不熟悉使用脚本从 Internet 下载文件。到目前为止，我主要使用 python 作为 Matlab 的替代品（使用 numpy/scipy）。

我的目标：我想使用 python 自动从 Internet 数据库 ( http://dna.korea.ac.kr/vhot/ ) 下载大量 .csv 文件。我想这样做是因为手动下载我需要的 1000 多个 csv 文件太麻烦了。只能使用 UI 访问数据库，您必须在其中从下拉菜单中选择几个选项，经过一些步骤后最终得到指向 .csv 文件的链接。我发现您在填写下拉菜单并按“搜索”后获得的 url 包含下拉菜单的所有参数。这意味着我可以更改它们而不是使用下拉菜单，这很有帮助。

该网站的示例 url 是（我们称之为url1）： url1 = http://dna.korea.ac.kr/vhot/search.php?species=Human&selector=drop&mirname=&mirname_drop=hbv-miR-B2RC&pita=on&set= and&miranda_th=-5&rh_th=-10&ts_th=0&mt_th=7.3&pt_th=99999&gene=

在此页面上，我可以选择 5 个 csv 文件，一个示例将我定向到以下 url：

url2 = http://dna.korea.ac.kr/vhot/download.php?mirname=hbv-miR-B2RC&species_filter=species_id+%3D+9606&set=and&gene_filter=&method=pita&m_th=-5&rh_th=-10&ts_th=0&mt_th=7.3&pt_th =99999&targetscan=&miranda=&rnahybrid=µt=&pita=on

但是，这不直接包含 csv 文件，但似乎是一个“重定向”（对我来说是一个新术语，我是通过谷歌搜索找到的，如果我错了，请纠正我）。

一件奇怪的事。我似乎必须在浏览器中加载 url1 才能访问 url2 （我不知道它是否必须是同一天或小时。url2 今天对我不起作用，昨天对我起作用。只有在访问 url1 之后它再次起作用了吗...）。如果我在 url2 之前没有访问 url1，我会从浏览器中得到“无结果”而不是 csv 文件。有谁知道这里发生了什么？

但是，我的主要问题是我无法从 python 保存 csv 文件。我试过使用urllib、urllib2和request包，但我无法让它工作。据我了解，Requests包应该处理重定向，但我无法使其工作。

以下网页的解决方案似乎对我不起作用（或者我搞砸了）：

stackoverflow.com/questions/7603044/how-to-download-a-file-returned-indirectly-from-html-form-submission-pyt

stackoverflow.com/questions/9419162/python-download-returned-zip-file-from-url

techniqal.com/blog/2008/07/31/python-file-read-write-with-urllib2/

我尝试过的一些事情包括：

import urllib2
import csv
import sys

url = 'http://dna.korea.ac.kr/vhot/download.php?mirname=hbv-miR-B2RC&species_filter=species_id+%3D+9606&set=or&gene_filter=&method=targetscan&m_th=-5&rh_th=-10&ts_th=0&mt_th=7.3&pt_th=-10&targetscan=on&miranda=&rnahybrid=&microt=&pita='

#1
u = urllib2.urlopen(url)
localFile = open('file.csv', 'w')
localFile.write(u.read())
localFile.close()

#2
req = urllib2.Request(url)
res = urllib2.urlopen(req)
finalurl = res.geturl()
pass
# finalurl = 'http://dna.korea.ac.kr/vhot/download.php?mirname=hbv-miR-B2RC&species_filter=species_id+%3D+9606&set=or&gene_filter=&method=targetscan&m_th=-5&rh_th=-10&ts_th=0&mt_th=7.3&pt_th=-10&targetscan=on&miranda=&rnahybrid=&microt=&pita='

#3
import requests
r = requests.get(url)
r.content
pass
#r.content =  "< s c r i p t > location.replace('download_send.php?name=qgN9Th&type=targetscan'); < / s c r i p t >"

#4
import requests
r = requests.get(url, 
allow_redirects=True,
data={'download_open': 'Download', 'format_open': '.csv'})
print r.content
# r.content = "

#5
import urllib
test1 = urllib.urlretrieve(url, "test.csv")
test2 = urllib.urlopen(url)
pass

对于#2、#3 和#4，输出显示在代码之后。对于#1 和#5，我只得到一个 .csv 文件</script>'

选项#3 只是给了我一个新的重定向，我认为这对我有帮助吗？

有人可以帮我解决我的问题吗？

score 4 · Accepted Answer

该页面不发送HTTP Redirect，而是通过 JavaScript 完成重定向。 urllib并且requests不处理 javascript，因此他们无法访问下载 url。您必须自己提取最终的下载网址，然后使用任何方法打开它。

re您可以使用带有正则表达式的模块提取 URL，例如r'location.replace\((.*?)\)'

score 1 · Accepted Answer

根据 ch3ka 的回复，我想我可以正常工作了。从源代码我得到java重定向，从这个重定向我可以得到数据。

#Find source code
redirect = requests.get(url).content

#Search for the java redirect (find it in the source code) 
# --> based on answer ch3ka
m = re.search(r"location.replace\(\'(.*?)\'\)", redirect).group(1)

# Now you need to create url from this redirect, and using this url get the data
data = requests.get(new_url).content

python - 在 python 中从网络（带有重定向）下载 .csv 文件

2 回答 2

Related

Reference