Python 请求模块未从 Web 服务器获取最新数据

Posted

技术标签:

【中文标题】Python 请求模块未从 Web 服务器获取最新数据【英文标题】:Python Requests Module Not Getting Latest Data from Web Server 【发布时间】:2019-06-20 05:58:02 【问题描述】:

在下面的代码 sn-p 中,您可以看到我正在尝试从 NCAA 男篮网站上抓取一些数据。

import requests

url = "https://www.ncaa.com/scoreboard/basketball-men/d1/"

response = requests.get(url)
html = response.text

print(html)
print(response.headers)
print("\n\n")
print(response.request.headers)

该网站列出了游戏及其得分。我想出了如何使用 Python Requests 获取 HTTP 请求所需的所有数据,然后使用 BeautifulSoup 从 HTML 中提取数据。 The full scraper is here if you'd like to take a look.

问题:当 Requests 从 NCAA 网站获得响应时,数据比实际网站上的数据要旧得多(有时至少 30 或 40 分钟)。 p>

我已经在谷歌上搜索了好几个小时。在阅读了Python Requests docs 之后,我相信我已经发现 NCAA 网络服务器正在发送过时的数据。但我不明白为什么它会在向 Google Chrome(或任何网络浏览器)发送正确数据时发送我的程序过时的数据。

我认为服务器发送过时数据的原因是,当我打印响应标头时,其中一项是 'Last-Modified': 'Sat, 26 Jan 2019 17:49:13 GMT' 而另一个是 'Date': 'Sat, 26 Jan 2019 18:20:29 GMT',所以看起来服务器在正确的时间收到了请求,但提供的数据没有'有一段时间没有修改了。

我的问题:你知道为什么会发生这种情况吗?我是否需要在我的 HTTP 请求中添加一些内容,以使服务器向我发送与发送 Web 浏览器一致的数据?

附:我很抱歉这个冗长的问题。我尽量保持简洁,但仍然清楚地解释事情。

【问题讨论】:

您是否尝试在请求中添加标头? 添加标题似乎不起作用。它仍然没有提取最新数据。但是,我正在努力实施您的 JSON 解决方案,因为这似乎可以解决问题。我现在只需要阅读有关使用 Python 或 BeautifulSoup 解析 JSON 的内容。谢谢! 你不需要 BeautifulSoup 来解析。使用我在下面的实现来获取 json 响应。这只是你想如何展平 json 格式的问题。在下面查看我的解决方案。我添加了一条可能对您有帮助的额外行。 【参考方案1】:

requests.get() 之前,尝试添加标题:

import requests

url = "https://www.ncaa.com/scoreboard/basketball-men/d1/"

headers = 'User-Agent' : 'Mozilla/5.0 (Windows NT 10.0; Win64; x64) AppleWebKit/537.36 (KHTML, like Gecko) Chrome/71.0.3578.98 Safari/537.36'   


response = requests.get(url, headers = headers)
html = response.text

我的另一个建议是使用:

url = 'https://data.ncaa.com/casablanca/scoreboard/basketball-men/d1/2019/01/26/scoreboard.json'

并使用 json 包来读取它。一切都以漂亮的 JSON 格式实时呈现在您面前

代码

import json
import requests

url = 'https://data.ncaa.com/casablanca/scoreboard/basketball-men/d1/2019/01/26/scoreboard.json'
headers = 'User-Agent' : 'Mozilla/5.0 (Windows NT 10.0; Win64; x64) AppleWebKit/537.36 (KHTML, like Gecko) Chrome/71.0.3578.98 Safari/537.36'    

response = requests.get(url, headers = headers)

jsonStr = response.text

jsonObj = json.loads(jsonStr)

我检查了一下,JSON 对象确实返回了实时比分/数据。您需要做的就是更改 URL 2019/01/26 中的日期,以获取游戏之前的日期完成数据。


编辑 - 附加

这可以帮助您提取数据。请注意我如何将其更改为今天的日期以获取当前数据。它为您提供了一个不错的数据框:

from pandas.io.json import json_normalize
import json
import requests

url = 'https://data.ncaa.com/casablanca/scoreboard/basketball-men/d1/2019/01/27/scoreboard.json'
headers = 'User-Agent' : 'Mozilla/5.0 (Windows NT 10.0; Win64; x64) AppleWebKit/537.36 (KHTML, like Gecko) Chrome/71.0.3578.98 Safari/537.36'    

# Thanks to InfectedDrake wisdom, the following 3 lines that I previously had can be replaced by a single line. See below
#response = requests.get(url, headers = headers)
#jsonStr = response.text
#jsonObj = json.loads(jsonStr)

jsonObj = requests.get(url, headers = headers).json()

result = json_normalize(jsonObj['games'])

【讨论】:

非常感谢!非常感谢您的帮助! 注意:requests 有 built-in json support。 @InfectedDrake 真的吗!?不知道。谢谢。那我得看看那个,因为我一直都是这样做的。 @chitown88 这也会有疯狂三月游戏吗?是否有比赛日程的 json 提要? @FamicTech 看起来确实会有锦标赛分数。 IE。如果你回去看看去年的比赛日期之一https://data.ncaa.com/casablanca/scoreboard/basketball-men/d1/2018/03/25/scoreboard.json,你会看到"bracketRound": "Elite Eight®"。就时间表而言,我认为它会像当前一样显示,让您可以向前跳并查看即将到来的游戏。还有https://data.ncaa.com/casablanca/carmen/brackets/championships/basketball-men/d1/2019/data.json 可以得到它,但在宣布播种之前显然是空白的。【参考方案2】:

尝试更改请求标头中的用户代理,使其与您的 Google Chrome 用户代理相同,方法是将其添加到您的标头中:

headers = 
    'User-Agent': 'Add your google chrome user-agent here'

【讨论】:

谢谢斯蒂芬!顺便说一句,我喜欢你的 GitHub 个人资料...“while (1) code;skate; ”【参考方案3】:

如上述答案所述,您需要做的就是设置一个合法的用户代理。因此添加标题以模拟浏览器:

# This is a standard user-agent of Chrome browser running on Windows 10 
headers =  'User-Agent': 'Mozilla/5.0 (Windows NT 10.0; Win64; x64) AppleWebKit/537.36 (KHTML, like Gecko) Chrome/71.0.3578.98 Safari/537.36' 

此外,您可以添加另一组标题来假装(更多)像合法浏览器。添加更多这样的标题:

headers =  
'User-Agent': 'Mozilla/5.0 (Windows NT 10.0; Win64; x64) AppleWebKit/537.36 (KHTML, like Gecko) Chrome/71.0.3578.98 Safari/537.36', 
'Accept' : 'text/html,application/xhtml+xml,application/xml;q=0.9,*/*;q=0.8', 
'Accept-Language' : 'en-US,en;q=0.5', 
'Accept-Encoding' : 'gzip', 
'DNT' : '1', # Do Not Track Request Header 
'Connection' : 'close' 

【讨论】:

以上是关于Python 请求模块未从 Web 服务器获取最新数据的主要内容,如果未能解决你的问题,请参考以下文章

Firebase admob 未从 pod 或服务器获取最新的 google ad mob SDK

UIImageView+AFNetworking 未从服务器检索最新图像

Axios 拦截器未从 vuex 商店获取当前用户身份验证令牌

服务器未从 restkit 的 web 服务调用接收正文对象

请求正文未从 aws-serverless-express 模块进入 app.js 文件

静态Web服务器-返回指定页面数据Python解释器详解实现代理池的API模块