首页
沸点
课程
APP
AI用量
作品广场
专家标注
搜索历史
清空
创作者中心
写文章
发沸点
写笔记
写代码
草稿箱
创作灵感
查看更多
登录
注册
排行榜
综合
后端
前端
Android
iOS
人工智能
开发工具
代码人生
阅读
综合
后端
排行榜
前端
Android
iOS
人工智能
开发工具
代码人生
阅读
全部
后端
Java
Python
数据库
前端
架构
AI编程
Elasticsearch
人工智能
展开
全部
后端
Java
Python
数据库
前端
架构
AI编程
Elasticsearch
人工智能
Go
面试
Agent
程序员
Spring Boot
大数据
暂无数据
推荐
最新
从元数据到数据地图:企业数据治理的第一块地基
数据治理的第一步,不是马上写质量规则,也不是先画复杂血缘图,而是把数据资产看清楚、讲明白、管起来。技术元数据让资产可见,业务元数据让资产可懂,操作元数据让资产可信。
OpenMetadata VS DataHub VS Atlas VS Gravitino
OpenMetadata和DataHub像面向用户、平台和AI的元数据治理与发现层;Atlas像Hadoop/Ranger体系中的治理基础设施;Gravitino像统一Catalog与元数据访问控制面
Kafka 接入 AI 的三条路线:MCP 提案、会话记忆与实时上下文
Kafka 接入 AI 的三条路线:第一方 MCP Server 提案、Streams 会话记忆、Flink SQL 实时上下文,附选型对比与权限清单
每天认识一个组件:元数据平台OpenMetadata
OpenMetadata 的核心价值:把分散在数据生态中的技术元数据、业务语义、血缘关系、质量信号、所有权和治理策略连接成统一的元数据知识图谱。
大数据数据治理体系建设:从平台能力到组织闭环的完整蓝图
大数据数据治理的完整框架,概括为一句话:以组织责任确定“谁负责”,以制度规范定义“按什么规则负责”,以流程闭环保证“问题如何被解决”,以技术工具支撑“规则如何被执行”,以指标度量回答“治理是否有效”。
从 ClickHouse 迁移到 Doris:SQL 兼容、同步与验证清单(实战笔记)
掘金开发者实战笔记。 摘要:随着团队对标准 SQL、多表关联和高并发在线查询的需求增加,不少同学开始评估从 ClickHouse 迁移到 Apache Doris。Doris 由 Apache 软件基
Doris 还是 ClickHouse?一张表说清 6 个关键差异(实战笔记)
掘金开发者实战笔记。 摘要:Apache Doris 与 ClickHouse 都是当下主流的开源 OLAP 引擎。Doris 由 Apache 软件基金会管理(Apache 顶级项目),其企业级支持
Apache Iceberg Variant 类型:v3 半结构化数据不再「二选一」
你团队里大概率有一张这样的表:用户行为埋点、IoT 设备上报、或者某个第三方服务的 Webhook 回调。它们的共同点——schema 老变。今天上游加个 coupon_id,明天把 address
Doris 直查 Paimon 索引:快手湖上向量检索的共建与落地
LLM 与 RAG 应用普及后,语义检索成为数据平台的常规需求。常见做法是把向量连同过滤字段、返回字段一起同
Apache Doris 选型实操:4 个维度 Checklist 与验证要点
选型 Checklist 总览 维度 验证指标 Doris 关键能力 复杂多表 Join 跨表关联延迟、优化器稳定性 ClickBench 多表快约 10%、RTABench 第一 湖仓一体 可直查的
Apache Doris 高并发点查与实时写入笔记:一套引擎统一实时数仓与在线服务
背景:为什么点查 + 实时写入是分水岭 很多 OLAP 引擎擅长「离线大扫描」,但真实业务往往要求: 用户侧高并发点查(画像、实时看板、风控规则命中); 业务库高吞吐实时写入(订单、行为、设备上报);
Apache Doris 多表 Join 优化实战:从 CBO 到 Colocate Join 配置(附 SQL)
为什么多表 Join 要单独优化 单表宽表聚合多数引擎都能跑,真正拖慢查询的是跨表关联:订单 Join 用户、商品、事件,星型/雪花模型上的即席查询。Doris 在 ClickBench 多表场景较
Apache Doris 存算分离实操:从对象存储接入到多计算集群配置(附 SQL)
为什么存算分离要单独配 「能挂对象存储」只是起点,生产要看三件事:扩缩容/故障恢复是否 ACID、读写与多租户能否隔离、弹性后延迟是否可控。Doris 用事务元数据服务 + 100% 弹性 BE +
Apache Doris+ Paimon 2.0:构建 Agentic AI 数据闭环
作者|李文强,Apache Doris PMC 成员、SelectDB 多模湖仓负责人 大模型决定 Agent 能理解什么,数据平台决定 Agent 在此时此刻能知道什么、能相信什么,以及行动之后能留
从数仓建模到 AI 数据底座:重新理解数据治理的位置
数据治理体系:数仓建模解决“如何表达业务”,数据中台解决“如何复用资产”,湖仓一体解决“如何统一存储与计算”,实时数仓解决“如何低延迟可信计算”,AI 数据底座解决“如何让模型使用可信上下文”。
MapReduce OutputFormat 解析:结果怎么从键值对变成文件
MapReduce 处理完数据后,最后一步是把结果写出去。OutputFormat 就是干这个的——**把 Reduce 输出的 `<key, value>` 键值对,转成目标格式写到指定位置。**
每天认识一个组件:数据治理Apache Atlas
Apache Atlas 的核心价值,是把分散在数据平台中的技术元数据、业务语义、分类标签、血缘关系和安全策略组织到一个统一治理框架中。
每天认识一个组件:统一 Shuffle 引擎Apache Uniffle
Apache Uniffle定义为面向分布式计算引擎的高性能、通用远程 Shuffle服务,支持 Spark、MR、Tez,并提供 K8s Operator 用于创建、配置和管理 Uniffle实例。
大数据数据治理到底治理什么:从“数据可用”到“数据可信”
本文从数据混乱、口径不一、任务失控、权限粗放四类真实场景切入,解释数据治理为什么必须做、到底治理什么、治理到什么边界,以及技术团队该如何理解治理的业务价值和技术边界。
把湖仓一体放进 K8s:Iceberg、Hudi、Paimon 如何重塑云原生大数据架构
Iceberg/Hudi/Paimon的出现,大数据架构正从“文件湖”走向“事务表”,从“离线数仓”走向“流批一体湖仓”;K8s 的普及让大数据计算从固定集群走向弹性、声明式、可观测、可治理的运行方式