python - 如何处理python3中URL中的unicode字符串？

Question

# -*- coding: utf-8 -*- 
# Python3
import urllib
import urllib.request as url_req
opener = url_req.build_opener()
url='http://zh.wikipedia.org/wiki/'+"毛泽东"
opener.open(url).read()
# opener.open(url.encode("utf-8")).read()
# # doesn't work either

当我运行它时，它抱怨说：

UnicodeEncodeError: 'ascii' codec can't encode characters in position 10-12: ordinal not in range(128)

但我不能使用.encode()任何一个，因为它会抱怨：

Traceback (most recent call last):
  File "t.py", line 8, in <module>
    opener.open(url.encode("utf-8")).read()
  File "/usr/local/Cellar/python3/3.2.2/lib/python3.2/urllib/request.py", line 360, in open
    req.timeout = timeout
AttributeError: 'bytes' object has no attribute 'timeout'

任何人都知道如何处理？

score 24 · Accepted Answer

您可以使用urllib.parse.quote()对 URL 的路径部分进行编码。

#!/usr/bin/env python3
from urllib.parse   import quote
from urllib.request import urlopen

url = 'http://zh.wikipedia.org/wiki/' + quote("毛泽东")
content = urlopen(url).read()

score 11 · Accepted Answer

奇妙的requests库为您提供了开箱即用的功能：

>>> url='http://zh.wikipedia.org/wiki/'+"毛泽东"
>>> import requests
>>> r = requests.get(url)
>>> len(r.content)
818747

score 2 · Accepted Answer

您不能使用任意 unicode 字符串作为 URL 的一部分。URL 必须正确编码。有关详细信息，请参见此处：

http://www.w3schools.com/tags/ref_urlencode.asp

特别是您想使用 Python API 的 urllib.quote() 或 urllib.quote_plus() 方法来正确引用您的 URL。

http://docs.python.org/library/urllib.html

python - 如何处理python3中URL中的unicode字符串？

3 回答 3

Related

Reference