python - 使用 pyspark 脚本从 bigquery 加载表到 spark 集群

Question

我在 bigquery 中加载了一个数据表，我想通过 pyspark .py 文件将它导入到我的 spark 集群中。

我在Dataproc + BigQuery 示例中看到了 - 有可用的吗？有一种方法可以使用 scala 在 spark 集群中加载 bigquery 表，但是有没有办法在 pyspark 脚本中执行此操作？

score 5 · Accepted Answer

这来自这个问题中的@MattJ 。这是连接到 Spark 中的 BigQuery 并执行字数统计的示例。

import json
import pyspark
sc = pyspark.SparkContext()

hadoopConf=sc._jsc.hadoopConfiguration()
hadoopConf.get("fs.gs.system.bucket")

conf = {"mapred.bq.project.id": "<project_id>", "mapred.bq.gcs.bucket": "<bucket>",
    "mapred.bq.input.project.id": "publicdata", 
    "mapred.bq.input.dataset.id":"samples", 
    "mapred.bq.input.table.id": "shakespeare"  }

tableData = sc.newAPIHadoopRDD(
    "com.google.cloud.hadoop.io.bigquery.JsonTextBigQueryInputFormat",
    "org.apache.hadoop.io.LongWritable", "com.google.gson.JsonObject", 
    conf=conf).map(lambda k: json.loads(k[1])).map(lambda x: (x["word"],
    int(x["word_count"]))).reduceByKey(lambda x,y: x+y)

print tableData.take(10)

您将需要更改<project_id>并<bucket>匹配项目的设置。

python - 使用 pyspark 脚本从 bigquery 加载表到 spark 集群

1 回答 1

Related

Reference