数据分析数据可视化大数据后端前端任务调度【免费下载链接】zeppelinWeb-based notebook that enables>项目地址https://gitcode.com/gh_mirrors/zeppe/zeppelin点击查看免费下载Apache Zeppelin 是支持数据驱动、交互式数据分析与协同文档的 Web 式 Notebook可运行 SQL、Scala 等解释器。在生产实践中Zeppelin 常与 CDHCloudera Distribution Including Apache Hadoop集群配合将 Spark 任务以 YARN 模式提交到集群执行。本指南以仓库文档 docs/setup/deployment/cdh.md 为主线详细讲解如何通过 Cloudera QuickStart Docker 镜像搭建 CDH 环境、启动 Zeppelin 并配置 Spark 解释器yarn-client模式完成后你将能够从 Zeppelin Notebook 提交 Spark 作业并在 YARN ResourceManager 中查看任务运行状态。适用前提本方案面向快速验证与开发环境依赖 Docker 与 Cloudera 官方 QuickStart 镜像并非生产级集群搭建流程。生产环境请参考 docs/setup/deployment/yarn_install.md 等独立部署方案。1. 导入 Cloudera QuickStart Docker 镜像Cloudera 官方在 Docker Hub 上发布了集成 CDH 的 QuickStart 容器镜像镜像内已预装 HadoopHDFS/YARN、Hive 等组件。要获取该镜像只需直接拉取docker pull cloudera/quickstart:latest拉取完成后可用docker images确认镜像已就绪。该镜像既是本教程中 CDH 环境的载体也承载了后续步骤中 Zeppelin 需要连接的 HDFS 与 YARN 服务。2. 运行 CDH 容器使用以下docker run命令启动 CDH QuickStart 容器。命令通过-p参数把容器内的 Hadoop、YARN、HDFS 等服务的端口一一映射到宿主机从而让宿主机上的 Zeppelin 能够访问集群docker run -it \ -p 80:80 \ -p 4040:4040 \ -p 8020:8020 \ -p 8022:8022 \ -p 8030:8030 \ -p 8032:8032 \ -p 8033:8033 \ -p 8040:8040 \ -p 8042:8042 \ -p 8088:8088 \ -p 8480:8480 \ -p 8485:8485 \ -p 8888:8888 \ -p 9083:9083 \ -p 10020:10020 \ -p 10033:10033 \ -p 18088:18088 \ -p 19888:19888 \ -p 25000:25000 \ -p 25010:25010 \ -p 25020:25020 \ -p 50010:50010 \ -p 50020:50020 \ -p 50070:50070 \ -p 50075:50075 \ -h quickstart.cloudera --privilegedtrue \ agitated_payne_backup /usr/bin/docker-quickstart;各关键端口与 CDH 组件的对应关系可结合仓库中的 CDH 集群配置验证端口服务/用途8020HDFS NameNode RPCfs.defaultFS见 core-site.xml8030 / 8032 / 8033YARN ResourceManager 调度器 / RPC / 管理地址见 yarn-site.xml8088YARN ResourceManager Web UI50070 / 50075 / 50010 / 50020HDFS NameNode Web UI / DataNode HTTP / DataNode RPC / DataNode IPC见 hdfs-site.xml9083Hive Metastore4040Spark Application Web UI命令中的agitated_payne_backup是容器名称示例源自原文档可替换为任意自定义名称-h quickstart.cloudera设置容器主机名这与镜像内 Hadoop 默认的 hostname 绑定方式相关不建议省略--privilegedtrue是 QuickStart 镜像启动脚本所需的特权模式。3. 验证 CDH 运行状态容器启动后通过 Web UI 验证 CDH 是否正常运行HDFS NameNode Web UIhttp://hostname:50070/YARN ResourceManager Web UIhttp://hostname:8088/cluster其中hostname为宿主机地址本机可填localhost。若能正常打开 HDFS 与 YARN 页面说明 CDH 环境已就绪可以进入 Zeppelin 与 Spark 解释器的配置阶段。仓库镜像启动脚本 entrypoint.sh 展示了这一环境的典型启动序列先启动 sshd再执行start-dfs.sh、start-yarn.sh随后hdfs dfsadmin -safemode leave退出安全模式并把 Spark 发行版库上传到 HDFS 的/spark目录供 YARN 集群模式分发使用。这些脚本逻辑印证了 HDFS 与 YARN 是后续 Spark 提交的基础设施。4. 配置 Zeppelin 的 Spark 解释器4.1 设置环境变量要让 Zeppelin 以 YARN 模式连接 CDH 集群需要把 Hadoop 与 Spark 的路径配置到 Zeppelin 的环境文件conf/zeppelin-env.sh中export HADOOP_CONF_DIR[your_hadoop_conf_path] export SPARK_HOME[your_spark_home_path]这两个环境变量的含义在仓库模板 conf/zeppelin-env.sh.template 中也有明确注释HADOOP_CONF_DIRHadoop 配置目录其中存放yarn-site.xml、core-site.xml等配置文件Zeppelin 据此获知 YARN ResourceManager 与 HDFS 地址。原文档明确指出该路径在/scripts/docker/spark-cluster-managers/cdh/hdfs_conf仓库中该目录确实包含四份完整配置core-site.xml、hdfs-site.xml、mapred-site.xml、yarn-site.xml。这些配置将fs.defaultFS指向hdfs://0.0.0.0:8020、YARN 调度地址指向0.0.0.0:8030、Web UI 地址指向0.0.0.0:8088与上一步的端口映射一一对应。SPARK_HOMESpark 安装目录。设置后 Zeppelin 会使用spark-submit启动 Spark 解释器进程而不是加载内嵌的 Spark 二进制详见模板中 Use provided spark installation 注释段。从源码结构看SparkStringConstants.java 中同时定义了spark.master属性与SPARK_MASTER环境变量两个键名说明 Spark 的 master 地址既可以通过解释器属性配置也可以借由环境变量注入二者最终都会汇总到解释器设置中。4.2 设置 spark.master 为 yarn-client在 Zeppelin 的Interpreters设置页面中将 Spark 解释器的spark.master设置为yarn-client使 Spark 作业以客户端模式提交到 YARN该配置项的定义位于 Spark 解释器的注册清单 interpreter-setting.json其描述为 Spark master uri. local | yarn-client | yarn-cluster | spark master address of standalone mode, ex) spark://master_host:7077即支持local、yarn-client、yarn-cluster以及 standalone 的spark://master_host:7077等多种取值。在 CDH 场景下选择yarn-client意味着 Driver 运行在 Zeppelin 侧、Executor 由 YARN 调度分配。同时可以确认HADOOP_CONF_DIR的配置已正确生效——Zeppelin 会从该目录读取yarn-site.xml获取 ResourceManager 地址从而将任务提交到映射在8088端口的 YARN 集群。5. 运行 Zeppelin 并验证 Spark 作业完成上述配置后启动 Zeppelin新建一个 Notebook创建一个段落并运行 Spark 解释器代码例如 Scala 的sc.version或一段简单的 SQL/转换逻辑。运行时你可以看到类似如下的段落执行界面随后打开 YARN ResourceManager 的应用列表页http://hostname:8088/cluster/apps如果在应用列表中能看到 Zeppelin 提交的 Spark Application 且状态为 RUNNING即表示 Zeppelin 已成功以yarn-client模式接入 CDH 集群Spark 作业在 YARN 上正常调度执行。从源码角度看这一行为与 Spark 解释器的实现一致在 SparkScala212Interpreter.scala 与 SparkScala213Interpreter.scala 中均有针对sparkMaster yarn-client的分支处理逻辑例如在 yarn-client 模式下设置对应的上下文与内存参数这说明 Zeppelin 对不同 Spark 部署模式确实做了专门适配。此外IPySparkInterpreter.java 也只在 embedded、local 或 yarn-client 模式下设置 PYTHONPATH若你后续使用 PySpark 而非 Scala同样建议保持该模式。6. 常见问题与排障提示YARN 页面打不开检查第 2 步中8088端口是否已正确映射以及容器是否已完整启动HDFS 与 YARN 启动需要一定时间。任务提交失败、找不到 ResourceManager确认HADOOP_CONF_DIR指向的目录确实包含有效的yarn-site.xml且其中的yarn.resourcemanager.address与 Zeppelin 所在宿主机可访问的地址一致。SPARK_HOME未生效Zeppelin 只在显式设置SPARK_HOME时才用spark-submit启动解释器进程否则回退到内嵌 SparkCDH 集成场景务必显式导出。端口冲突QuickStart 镜像映射的端口较多若宿主机已有服务占用可调整-p映射到其他宿主端口同时需要同步修改HADOOP_CONF_DIR下配置文件或相关设置中的地址。7. 进一步阅读独立 YARN 集群部署docs/setup/deployment/yarn_install.mdSpark 集群模式standalone说明docs/setup/deployment/spark_cluster_mode.mdZeppelin 环境变量完整模板conf/zeppelin-env.sh.templateSpark 解释器属性注册定义spark/interpreter/src/main/resources/interpreter-setting.jsonCDH 容器 HDFS/YARN 配置示例scripts/docker/spark-cluster-managers/cdh/hdfs_confSpark 解释器源码Scala 2.12spark/scala-2.12/src/main/scala/org/apache/zeppelin/spark/SparkScala212Interpreter.scala赞分享数据分析数据可视化大数据后端前端任务调度【免费下载链接】zeppelinWeb-based notebook that enables>项目地址https://gitcode.com/gh_mirrors/zeppe/zeppelin点击查看免费下载相关推荐Apache Zeppelin Docker部署完全指南Apache Zeppelin Docker部署完全指南 概述 Apache Zeppelin作为一款强大的交互式数据分析和可视化工具通过Docker容器化部数据分析数据可视化大数据后端前端任务调度Apache Zeppelin 的 Docker 部署与镜像构建完整指南Apache Zeppelin 的 Docker 部署与镜像构建完整指南 本指南基于 Apache Zeppelin 仓库中 docs/setup/deploy数据分析数据可视化大数据后端前端任务调度Apache Flink 基于 Docker 与 Docker Compose 的集群部署完整指南Apache Flink 基于 Docker 与 Docker Compose 的集群部署完整指南 导读 本文是 Apache Flink 官方部署文档中 Do后端大数据流处理批处理上一篇yuzu Switch 模拟器入门三步配好环境让第一局游戏跑起来下一篇rueidis开发者友好命令构建器10个实用技巧提升Redis开发效率创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
阅读完成 · 觉得有帮助?