尝试进行实验并了解有关用于网络抓取的套接字的更多信息。
我正在尝试通过WebSockets从网站流式传输信息。我能够接收数据,但想知道什么是读取和解释来自其中的传入数据的正确方法。
我正在使用Python 3.7。我可以使用https://towardsdatascience.com/scraping-in-another-dimension-7c6890a156da中的示例建立连接
我正在尝试通过套接字将一些股价数据显示在https://finance.yahoo.com/quote/BTC-USD/chart上。
这是我正在使用的代码:
import websocket
import json
from websocket import create_connection
headers = json.dumps({
'Accept-Encoding':'gzip deflat,br',
'Accept-Language':'en-US,en;q=0.9,zh-TW;q=0.8,zh;q=0.7,zh-CN;q=0.6',
'Cache-Control': 'no-cache',
'Connection': 'Upgrade',
'Host': 'streamer.finance.yahoo.com',
'Origin': 'https://finance.yahoo.com',
'Pragma': 'no-cache',
'Sec-WebSocket-Extensions': 'permessage-deflate; client_max_window_bits',
'Sec-WebSocket-Key': 'VW2m4Lw2Rz2nXaWO10kxhw==',
'Sec-WebSocket-Version': '13',
'Upgrade': 'websocket',
'User-Agent': 'Mozilla/5.0 (Windows NT 10.0; Win64; x64) AppleWebKit/537.36 (KHTML, like Gecko) Chrome/77.0.3865.90 Safari/537.36'
})
ws = create_connection('wss://streamer.finance.yahoo.com/',headers=headers)
ws.send('{"subscribe":["^GSPC","^DJI","^IXIC","^RUT","CL=F","GC=F","SI=F","EURUSD=X","^TNX","^VIX","GBPUSD=X","JPY=X","BTC-USD","^FTSE","^N225"]}')
while True:
result = ws.recv()
print(result)
ws.close()
这样我就可以得到如下结果:
CgReREpJFebCzkYYwJHv8LZbKgNESkkwCTgBRWYd6D5I7tDaigFlAOHuQtgBBA==
CgVKUFk9WBUX2ddCGMCR7/C2WyoDQ0NZMA44AUUVH9w+ZQCM7D7YAQg=
CghFVVJVU0Q9WBVA2Yw/GMCR7/C2WyoDQ0NZMA44AUXuDJI+ZQAgTTvYAQg=
CghHQlBVU0Q9WBUQO58/GMCR7/C2WyoDQ0NZMA44AUXz/fY/ZcDrwDzYAQg=
CgReVklYFYXrkUEYgKOB8LZbKgNXQ0IwCTgBRcRWCcBlwMzMvtgBBA==
CghHQlBVU0Q9WBUVOp8/GJCh7/C2WyoDQ0NZMA44AUWcrfY/ZQCtwDzYAQg=
CgVKUFk9WBUv3ddCGJCh7/C2WyoDQ0NZMA44AUVQ7t8+ZQCk8D7YAQg=
CghFVVJVU0Q9WBU424w/GJCh7/C2WyoDQ0NZMA44AUWi2pQ+ZQAQUTvYAQg=
不确定如何解释我收到的数据,或Web浏览器如何解释此数据。似乎浏览器正在接收与我相同的数据。
最佳答案
我的猜测是这是Protobuf编码的数据。通过查看yahoo财务页面的Javascript源代码,您可以看到,一旦订阅了报价器,则回复将由解码例程处理。
https://finance.yahoo.com/__finStreamer-worker.js
...在以下代码段中,从base64文本到字节再到Javascript对象(PricingData类型)的转换很明显。请注意protobuf的提及。
QuoteStreamer.prototype.handleWebSocketUpdate = function (event) {
try {
var PricingData = protobuf.roots.default.quotefeeder.PricingData;
var buffer = base64ToArray(event.data); // decode from base 64
var data = PricingData.decode(buffer); // Decode using protobuff
data = PricingData.toObject(data, { // Convert to a JS object
enums: String
});
接下来需要弄清楚的是Yahoo使用的Protobuf模式(然后可以使用它在Python中生成解码器),但是我不确定它是公开的。但是,您可以检查它们生成的实际Protobuf Javascript代码以执行解码,并尝试直接将其复制到Python中,或者对protobuf模式进行猜测。
Javascript解码器在这里:https://finance.yahoo.com/__finStreamer-proto.js