稀土掘金 稀土掘金
    • 首页
    • 沸点
    • 课程
    • APP
    • AI用量
    • 作品广场
    • 专家标注
      • 搜索历史 清空
        • 写文章
        • 发沸点
        • 写笔记
        • 写代码
        • 草稿箱
        创作灵感 查看更多
排行榜
综合
后端
前端
Android
iOS
人工智能
开发工具
代码人生
阅读
综合
后端
排行榜
前端
Android
iOS
人工智能
开发工具
代码人生
阅读
  • 全部
  • 后端
  • Java
  • Python
  • 数据库
  • 前端
  • 架构
  • AI编程
  • Elasticsearch
  • 人工智能
  • 展开
  • 全部
  • 后端
  • Java
  • Python
  • 数据库
  • 前端
  • 架构
  • AI编程
  • Elasticsearch
  • 人工智能
  • Go
  • 面试
  • Agent
  • 程序员
  • Spring Boot
  • 大数据
  • 暂无数据
    • 推荐
    • 最新
  • 从元数据到数据地图:企业数据治理的第一块地基
    数据治理的第一步,不是马上写质量规则,也不是先画复杂血缘图,而是把数据资产看清楚、讲明白、管起来。技术元数据让资产可见,业务元数据让资产可懂,操作元数据让资产可信。
    • 大大大大晴天
    • 17
    • 点赞
    大数据
    从元数据到数据地图:企业数据治理的第一块地基
  • OpenMetadata VS DataHub VS Atlas VS Gravitino
    OpenMetadata和DataHub像面向用户、平台和AI的元数据治理与发现层;Atlas像Hadoop/Ranger体系中的治理基础设施;Gravitino像统一Catalog与元数据访问控制面
    • 大大大大晴天
    • 41
    • 点赞
    大数据
    OpenMetadata VS DataHub VS Atlas VS Gravitino
  • Kafka 接入 AI 的三条路线:MCP 提案、会话记忆与实时上下文
    Kafka 接入 AI 的三条路线:第一方 MCP Server 提案、Streams 会话记忆、Flink SQL 实时上下文,附选型对比与权限清单
    • 程序员天天困
    • 28
    • 点赞
    后端 Kafka 大数据
    Kafka 接入 AI 的三条路线:MCP 提案、会话记忆与实时上下文
  • 每天认识一个组件:元数据平台OpenMetadata
    OpenMetadata 的核心价值:把分散在数据生态中的技术元数据、业务语义、血缘关系、质量信号、所有权和治理策略连接成统一的元数据知识图谱。
    • 大大大大晴天
    • 41
    • 点赞
    大数据
    每天认识一个组件:元数据平台OpenMetadata
  • 大数据数据治理体系建设:从平台能力到组织闭环的完整蓝图
    大数据数据治理的完整框架,概括为一句话:以组织责任确定“谁负责”,以制度规范定义“按什么规则负责”,以流程闭环保证“问题如何被解决”,以技术工具支撑“规则如何被执行”,以指标度量回答“治理是否有效”。
    • 大大大大晴天
    • 29
    • 点赞
    大数据
    大数据数据治理体系建设:从平台能力到组织闭环的完整蓝图
  • 从 ClickHouse 迁移到 Doris:SQL 兼容、同步与验证清单(实战笔记)
    掘金开发者实战笔记。 摘要:随着团队对标准 SQL、多表关联和高并发在线查询的需求增加,不少同学开始评估从 ClickHouse 迁移到 Apache Doris。Doris 由 Apache 软件基
    • SelectDB
    • 63
    • 点赞
    数据库 大数据 数据分析
  • Doris 还是 ClickHouse?一张表说清 6 个关键差异(实战笔记)
    掘金开发者实战笔记。 摘要:Apache Doris 与 ClickHouse 都是当下主流的开源 OLAP 引擎。Doris 由 Apache 软件基金会管理(Apache 顶级项目),其企业级支持
    • SelectDB
    • 63
    • 点赞
    数据库 大数据 数据分析
  • Apache Iceberg Variant 类型:v3 半结构化数据不再「二选一」
    你团队里大概率有一张这样的表:用户行为埋点、IoT 设备上报、或者某个第三方服务的 Webhook 回调。它们的共同点——schema 老变。今天上游加个 coupon_id,明天把 address
    • 面向Google编程
    • 47
    • 1
    后端 大数据
    Apache Iceberg Variant 类型:v3 半结构化数据不再「二选一」
  • Doris 直查 Paimon 索引:快手湖上向量检索的共建与落地
    LLM 与 RAG 应用普及后,语义检索成为数据平台的常规需求。常见做法是把向量连同过滤字段、返回字段一起同
    • SelectDB
    • 39
    • 点赞
    数据库 大数据 数据分析
  • Apache Doris 选型实操:4 个维度 Checklist 与验证要点
    选型 Checklist 总览 维度 验证指标 Doris 关键能力 复杂多表 Join 跨表关联延迟、优化器稳定性 ClickBench 多表快约 10%、RTABench 第一 湖仓一体 可直查的
    • SelectDB
    • 28
    • 点赞
    数据库 掘金技术征文 大数据
  • Apache Doris 高并发点查与实时写入笔记:一套引擎统一实时数仓与在线服务
    背景:为什么点查 + 实时写入是分水岭 很多 OLAP 引擎擅长「离线大扫描」,但真实业务往往要求: 用户侧高并发点查(画像、实时看板、风控规则命中); 业务库高吞吐实时写入(订单、行为、设备上报);
    • SelectDB
    • 39
    • 点赞
    数据库 大数据 数据分析
  • Apache Doris 多表 Join 优化实战:从 CBO 到 Colocate Join 配置(附 SQL)
    为什么多表 Join 要单独优化 单表宽表聚合多数引擎都能跑,真正拖慢查询的是跨表关联:订单 Join 用户、商品、事件,星型/雪花模型上的即席查询。Doris 在 ClickBench 多表场景较
    • SelectDB
    • 29
    • 点赞
    数据库 大数据 数据分析
  • Apache Doris 存算分离实操:从对象存储接入到多计算集群配置(附 SQL)
    为什么存算分离要单独配 「能挂对象存储」只是起点,生产要看三件事:扩缩容/故障恢复是否 ACID、读写与多租户能否隔离、弹性后延迟是否可控。Doris 用事务元数据服务 + 100% 弹性 BE +
    • SelectDB
    • 36
    • 点赞
    数据库 大数据 数据分析
  • Apache Doris+ Paimon 2.0:构建 Agentic AI 数据闭环
    作者|李文强,Apache Doris PMC 成员、SelectDB 多模湖仓负责人 大模型决定 Agent 能理解什么,数据平台决定 Agent 在此时此刻能知道什么、能相信什么,以及行动之后能留
    • SelectDB
    • 44
    • 点赞
    数据库 大数据 数据分析
  • 从数仓建模到 AI 数据底座:重新理解数据治理的位置
    数据治理体系:数仓建模解决“如何表达业务”,数据中台解决“如何复用资产”,湖仓一体解决“如何统一存储与计算”,实时数仓解决“如何低延迟可信计算”,AI 数据底座解决“如何让模型使用可信上下文”。
    • 大大大大晴天
    • 58
    • 点赞
    大数据
    从数仓建模到 AI 数据底座:重新理解数据治理的位置
  • MapReduce OutputFormat 解析:结果怎么从键值对变成文件
    MapReduce 处理完数据后,最后一步是把结果写出去。OutputFormat 就是干这个的——**把 Reduce 输出的 `<key, value>` 键值对,转成目标格式写到指定位置。**
    • isfox
    • 46
    • 点赞
    大数据
    MapReduce OutputFormat 解析:结果怎么从键值对变成文件
  • 每天认识一个组件:数据治理Apache Atlas
    Apache Atlas 的核心价值,是把分散在数据平台中的技术元数据、业务语义、分类标签、血缘关系和安全策略组织到一个统一治理框架中。
    • 大大大大晴天
    • 61
    • 点赞
    大数据
    每天认识一个组件:数据治理Apache Atlas
  • 每天认识一个组件:统一 Shuffle 引擎Apache Uniffle
    Apache Uniffle定义为面向分布式计算引擎的高性能、通用远程 Shuffle服务,支持 Spark、MR、Tez,并提供 K8s Operator 用于创建、配置和管理 Uniffle实例。
    • 大大大大晴天
    • 99
    • 点赞
    大数据
    每天认识一个组件:统一 Shuffle 引擎Apache Uniffle
  • 大数据数据治理到底治理什么:从“数据可用”到“数据可信”
    本文从数据混乱、口径不一、任务失控、权限粗放四类真实场景切入,解释数据治理为什么必须做、到底治理什么、治理到什么边界,以及技术团队该如何理解治理的业务价值和技术边界。
    • 大大大大晴天
    • 50
    • 点赞
    大数据
    大数据数据治理到底治理什么:从“数据可用”到“数据可信”
  • 把湖仓一体放进 K8s:Iceberg、Hudi、Paimon 如何重塑云原生大数据架构
    Iceberg/Hudi/Paimon的出现,大数据架构正从“文件湖”走向“事务表”,从“离线数仓”走向“流批一体湖仓”;K8s 的普及让大数据计算从固定集群走向弹性、声明式、可观测、可治理的运行方式
    • 大大大大晴天
    • 105
    • 点赞
    大数据
    把湖仓一体放进 K8s:Iceberg、Hudi、Paimon 如何重塑云原生大数据架构
    • 用户协议
    • 营业执照
    • 隐私政策
    • 关于我们
    • 使用指南
    • 友情链接
    • 更多后端文章
    • 举报邮箱: juejin@bytedance.com
    • 座机电话: 010-83434395
    • 京ICP备18012699号-3
    • 京ICP证:京B2-20191272
    • police 京公网安备11010802026719号
    • ©2026 稀土掘金