数据岗位面试题更新 2026-08-05

请说明 Presto 与 Hadoop 生态及 HDFS 的集成方式,涉及哪些关键组件和配置?

数据系统设计技术原理Apache HiveHDFSPresto

考察说明

考查对 Presto 与 Hadoop、HDFS 集成机制的理解,包括连接器、元数据、数据访问等。

回答思路

  1. 【回答框架 1】Presto 通过连接器(Connector)集成 Hadoop 生态,Hive Connector 是主要途径,它利用 Hive Metastore 获取表结构和分区信息,从而访问 HDFS 上的数据。
  2. 【回答框架 2】配置时需在 etc/catalog/hive.properties 中设置连接器名称和 Hive Metastore URI,例如 hive.metastore.uri=thrift://host:9083,并指定 HDFS 配置(如 hdfs-site.xml)以支持文件系统操作。
  3. 【回答框架 3】Presto 通过 HDFS 客户端(基于 Hadoop 配置)直接读取 HDFS 块,支持多种文件格式(如 ORC、Parquet),并可通过配置启用本地缓存或短路读取提升性能。
  4. 【回答框架 4】与 YARN 集成时,Presto 通常作为独立服务运行,但可以共享 HDFS 和 Hive 元数据,通过资源管理器协调资源。
  5. 【关键点 1】核心是通过 Hive Connector 访问 Hive Metastore 和 HDFS。
  6. 【关键点 2】需配置 hive.metastore.uri 和 HDFS 相关配置。
  7. 【关键点 3】支持直接读取 HDFS 上的常见文件格式。
  8. 【易错点 1】需注意 Hive 与 Presto 的版本兼容性,避免元数据 API 不匹配。
  9. 【易错点 2】HDFS 权限和 Kerberos 认证配置错误可能导致访问失败。