用 spark 查询 es 集群的时候特别慢,es 集群有三个节点,总共大概有 200 亿条数据,jvm 堆内存 32G。
spark 查询时 pushdown 了之后结果集大概有 20 亿条数据,一个简单的字段匹配查询要跑一两个小时,目前连接时只用到了这些配置
es.scroll.size="10000"
pushdown="true"
es.scroll.keepalive="10m"
有人有经验给点优化建议么?
spark 查询时 pushdown 了之后结果集大概有 20 亿条数据,一个简单的字段匹配查询要跑一两个小时,目前连接时只用到了这些配置
es.scroll.size="10000"
pushdown="true"
es.scroll.keepalive="10m"
有人有经验给点优化建议么?
