首页
沸点
课程
APP
AI用量
作品广场
专家标注
搜索历史
清空
创作者中心
写文章
发沸点
写笔记
写代码
草稿箱
创作灵感
查看更多
登录
注册
排行榜
综合
后端
前端
Android
iOS
人工智能
开发工具
代码人生
阅读
综合
后端
排行榜
前端
Android
iOS
人工智能
开发工具
代码人生
阅读
全部
后端
Java
Python
数据库
架构
前端
人工智能
Elasticsearch
Go
展开
全部
后端
Java
Python
数据库
架构
前端
人工智能
Elasticsearch
Go
AI编程
大数据
面试
程序员
Spring Boot
Rust
暂无数据
推荐
最新
元数据目录到数据资产运营:让好数据被看见、被复用、被持续经营
数据资产运营的关键产物是一套能解释决策的机制。责任人能收到并处理事件,消费者能看到质量证据,平台能说明推荐理由,治理团队能安全下架低价值资产,业务团队才能真正从“数据很多”走向“知道哪些数据值得用”。
【计算机毕设选题】基于Hadoop的电信网络诈骗话术语义特征挖掘分析系统源码 毕业设计 选题推荐 毕设选题 数据分析 机器学习
随着电信诈骗手段不断翻新,传统拦截方式难以应对多变话术。本系统基于Hadoop与Spark大数据框架,针对电信诈骗话术语义特征进行挖掘分析,帮助梳理诈骗套路,为反诈防护提供数据支撑与可视化参考。
每天认识一个组件:数据质量平台Apache Griffin
Apache Griffin(已退休)的历史价值在于,它较早把大数据质量问题抽象成平台化流程:规则定义、Spark 计算、指标沉淀、服务化管理和可视化展示。
数据平台到底是什么?一篇文章搞懂数据平台开发
数据平台是一套围绕数据采集、传输、处理、存储和分析构建的系统。本文从业务数据库出发,介绍数据平台的基本架构、数据仓库、数据湖以及数据平台开发的核心内容。
数据是怎么进入数据平台的?一文搞懂数据采集与数据同步
数据平台首先要解决数据从哪里来、如何进入的问题。本文介绍数据采集、全量同步、增量同步、CDC 以及 Kafka,帮助理解数据从业务系统进入数据平台的完整链路。
每天认识一个组件:远端数据服务Apache Celeborn
Apache Celeborn 的出现,本质上是大数据计算从“固定集群 + 本地临时文件”走向“弹性计算 + 独立中间数据服务”的结果。
面向湖仓一体的大数据安全治理:识别、授权、脱敏与审计
大数据安全治理本质是把“数据资产、敏感标签、分级分类、访问策略、脱敏规则、审计证据”连成一个闭环。敏感数据识别知道风险在哪里,分级分类知道风险有多高,行列级权限和动态脱敏控制暴露面,访问审计跟踪改进。
数据处理完放在哪里?一文搞懂数据仓库与数据湖
数据仓库面向结构化数据分析,数据湖强调大规模、多类型原始数据存储。本文介绍两者区别及 Lakehouse,并梳理数据从采集、处理到存储的完整链路。
数据进入平台后怎么处理?一文搞懂 ETL
ETL 是数据平台的核心处理环节,通过提取、清洗、转换、关联和聚合,将原始数据加工成可分析的数据,并进一步理解 ETL、ELT、批处理与实时处理的区别。
每天认识一个组件:向量化计算加速Apache Auron
Apache Auron的核心价值,是在保留Spark等分布式计算框架生态的同时把可支持的SQL/DataFrame执行片段迁移到Rust、Arrow和DataFusion组成的原生向量化执行路径中。
从规则到工单:大数据数据质量治理闭环
数据质量治理的终点是让异常进入一个稳定的处理系统。完整性、唯一性、及时性、准确性和一致性定义问题;规则配置、任务拦截和告警分级及时发现并控制扩散;问题工单和复盘机制则负责把问题真正修掉,并减少复发。
Doris 替换 ClickHouse:部署核查命令、常见问题排查与适配说明
以麒麟 V10 服务器版 + 鲲鹏 CPU 的三节点环境为例,说明把存量 ClickHouse 替换为国产化引擎时的执行顺序、命令片段与常见问题排查方式。当验收口径要求"数据库本身通过信创"时,代理层
把 JSON 埋点表迁到 Apache Doris VARIANT:一次完整排错记录
迁移当晚遇到的第一条报错长这样: 一张跑了两年、把整条 JSON 塞进 STRING 列的埋点表要迁到 Apache Doris 的 VARIANT 类型,从建表到导入到查询改写到最后把这条报错解决掉
每天认识一个组件:内存列式格式Apache Arrow
Apache Arrow 的核心价值,是为大数据系统提供一套统一、标准、跨语言的内存列式表示。它解决的不是“怎么把数据存得更小”,而是“当数据进入计算和交换阶段,如何少拷贝、少反序列化、少重复实现”。
快手基于 Apache Doris 千亿多模态检索的实践
在快手内部,基于 Apache Doris 深度定制优化的 Bleem 引擎,一直承载着商业化广告、AB 测试、风控圈定、电商数仓等核心业务,是快手大数据分析
Doris 替换 ClickHouse:部署核查命令、常见问题排查与适配说明
以麒麟 V10 服务器版 + 鲲鹏 CPU 的三节点环境为例,说明把存量 ClickHouse 替换为国产化引擎时的执行顺序、命令片段与常见问题排查方式。当验收口径要求"数据库本身通过信创"时,代理层
数据血缘与影响分析:从字段链路到变更治理和故障定位
表级血缘解决“数据集之间如何依赖”,字段级血缘解决“字段和指标如何计算”,任务级血缘解决“哪次运行导致了当前结果”。三者合在一起,才能让数据治理从“发现问题”走向“定位问题、评估变更、控制影响”。
日志成本打不下来?Doris 降本实操笔记:建表、参数、冷热分层与四个排错现场
这是一篇实操笔记,不是选型对比。默认你已经决定要试 Apache Doris,现在需要的是:表怎么建、参数怎么调、改完怎么验证、出问题怎么排。 配置都来自网易、中信银行信用卡中心的已披露生产实践,我把
Doris vs ClickHouse:企业 OLAP 走向下一阶段,两种技术路线如何选择
过去几年,ClickHouse 凭借优秀的列式存储、数据压缩和执行效率,在日志分析、明细查询等场景中快速普及,成为实时分析领域的重要技术选择。 与此同时,企业的数据分析需求也在发生变化。随着数据规模持
Doris vs ClickHouse:企业级分析场景下,OLAP 的能力边界正在如何变化?
过去评估 OLAP 数据库,最容易被量化的指标是查询性能。 一张几十亿甚至上百亿行的表,聚合查询需要多久?同样的机器规模下,谁能扫描更多数据?在日志分析、用户行为分析和大规模明细查询兴起的阶段,这些指