Elastic 9.5: Columnar 、 VectorDB 索引模式与自动校准,以及由 AI 驱动的告警分类整理

0 阅读16分钟

作者:来自 Elastic Sarah Leslie

今天,我们很高兴宣布,作为 Elasticsearch Platform 最新版本的 Elastic 9.5 正式发布。此次发布包含一系列新功能,旨在帮助开发者更充分地利用数据,更有信心地构建 AI agent,并通过在 ElasticsearchElastic ObservabilityElastic Security 中引入全新能力,提升安全运营水平。

Elasticsearch Platform

Elastic 9.5 有哪些新功能?

Elastic 9.5 持续提升 Elasticsearch 在效率、可观测性和性能方面的能力,帮助企业数据变得更加易于访问和更具价值。借助 Elastic 9.5,用户可以:

  • 借助 Columnar Mode 存储更多数据、实现更快查询并延长数据保留时间 —— 将 Elasticsearch 作为原生列式数据库
  • 借助 VectorDB 索引模式和自动校准,无需配置和索引调优 —— 开箱即用的向量搜索
  • 随着原生 Prometheus 和 PromQL 支持正式发布,将 Prometheus 工作负载迁移到 Elasticsearch
  • 助力实现 Alert Zero —— SOC 版本的 Inbox Zero —— 将告警队列缩减到真正重要的内容,由 agent 与分析师共同完成
  • 借助最新的 Elastic Agent Builder 增强功能构建更智能的 AI agent,包括 Agent Observability and Monitoring,以及高级人工参与审批( human-in-the-loop approvals )

请继续阅读下文,了解这些功能以及更多新增功能亮点。

Elasticsearch

Elastic 9.5 带来了多项改进,旨在帮助每位用户以更快的速度开展工作、更有信心地运营,并以更少的阻力从数据中获取更多价值。此次发布在 Elasticsearch Platform 的多个方面进行了创新,从数据存储与查询,到构建和治理 AI agent,再到 Kibana 仪表板增强功能。下面将详细介绍这些内容。

适用于任何工作负载的多信号数据存储

Elastic 很高兴宣布推出技术预览版的 Columnar Mode。这是一种可选启用( opt-in )的索引模式,默认情况下将每个字段仅存储一次到列式存储中,而不创建倒排索引,从而显著减少存储占用,并为更快的索引、更快的分析查询以及更长的数据保留时间奠定基础。它与现有索引模式一同提供,无需对 API、仪表板或集成进行任何修改。在此基础上, Columnar Logs 是首个专为日志数据打造的专用配置,它仅在 message 字段上保留一个倒排索引,因此在保持全文搜索速度的同时,其余所有数据均采用完全列式存储。最终结果是在不改变团队所依赖搜索体验的前提下,相比当前日志存储方式大幅降低存储占用。这两种模式均为可选启用,现有索引不会受到影响。

向量数据库

为检索增强生成( RAG )应用和 agentic AI 构建检索能力的团队,通常需要在创建索引时做出大量配置决策,而随着生产环境规模扩大,这项工作也会随之增加。我们推出这些功能,就是为了免去配置和索引调优的工作,让向量搜索开箱即用。

VectorDB 索引模式只需一个设置即可提供高性能向量搜索,无需任何手动配置。它会自动应用已经针对向量优化的默认配置,自动调优量化( quantization )、合并策略( merge policy )和缓存加载( cache loading ),使向量搜索更容易部署,并能够开箱即用地获得优异性能。

DiskBBQ 向量搜索的自动校准( auto-calibration )会基于索引中向量的统计分析,自动配置量化深度( quantization depth )、预处理( preconditioning )和过采样( oversampling )。原本需要专业知识和反复实验才能完成的调优工作,现在可借助 Elastic 开发的独特算法自动完成。

多模态 语义搜索(Multimodazl semantic search )让开发者能够更轻松地实现图像搜索。通常,图像搜索需要配置嵌入模型、摄取并嵌入图像,以及对查询进行嵌入。全新的 semantic 字段简化了这些步骤,使用户能够像使用 semantic_text 搜索文本一样轻松地搜索图像。

更多 Agent Builder 增强功能!

Elastic 9.5 为开发者在生产环境中构建 AI agent 提供了更高的可观测性和控制能力。现已推出技术预览版的 Agent Observability and Monitoring,可将大语言模型( LLM )调用、工具调用以及推理步骤作为 OpenTelemetry( OTel )跟踪数据记录到 Elasticsearch 中;同时,人工参与审批( human-in-the-loop approvals )可对敏感操作进行把关,并将每次决策记录到审计日志中。

开发者还可以直接通过聊天创建 skills、查询和工作流,只需描述所需能力,例如 “创建一个用于生成仪表板的工作流”。随后, Agent Builder 会自动起草配置、命名并保存,无需离开当前对话,从而减少配置时间,也无需深入了解底层配置模型。

AI 原生 Kibana

在 9.5 中,我们的 Dashboards & Visualizations API 已正式发布,为平台团队提供了一种稳定且受支持的方式,以代码创建、更新和管理仪表板及可视化。此外,聊天中的仪表板( dashboards in chat )现已正式发布,并带来了更高质量的聊天体验、更完善的控件创建能力以及更快的执行速度。

这些改进显著缩短了从数据到洞察的时间,无需用户手动构建仪表板,从而加快事件调查速度,因为更快获得清晰的可视化结果能够直接缩短问题解决时间。对于速度至关重要的使用场景,可启用 Fast Mode UI,使 Dashboards 和 Discover 中基于 STATS 的查询在采样数据集上运行,而不是扫描全部数据,并将结果推算回真实数据规模,同时保持与精确结果非常接近的准确性。

在数据所在位置实现更强大的自动化

Elastic 9.5 中的 Elastic Workflows 使自动化更易于构建,并且能够在运行之前准确展示工作流将执行的操作。自然语言创作( Natural language authoring )现已正式发布,并默认启用,因此团队只需使用自然语言描述所需的自动化流程,即可自动生成工作流。

版本管理功能现已内置,可跟踪每一次变更,允许团队比较任意两个版本,并通过一次点击回滚到可正常工作的版本,因此始终能够记录是谁在什么时候进行了哪些修改。

可视化模式( Visual mode )会将工作流以图形方式展示,使触发器、步骤、分支和逻辑与 YAML 并排显示,一目了然;拖放式编辑功能即将推出。

此外,人工参与审批( human-in-the-loop )现已扩展到 Kibana 之外。当工作流需要人工审批或提供意见时,它会暂停执行,并将请求发送到 Slack 等工具。自动化负责处理日常事务,而团队则专注于那些需要人工判断的决策。

这些都是 Elasticsearch Platform 的能力,可在 Search、Observability 和 Security 中统一使用。

Elastic Observability

Elastic 9.5 带来了多项可观测性升级,旨在让统一监控更快落地、更易于扩展。无论你是从 Prometheus 迁移、接入 Kubernetes,还是连接云平台和 SaaS 数据,都可以以更低的运维开销更轻松地开始使用。改进后的 SRE 工作流、托管集成以及面向 AI 的上下文,帮助团队更快地从检测进入诊断阶段。

原生 Prometheus 和 PromQL 支持正式发布

借助 9.5,整合可观测性与业界领先的指标数据比以往任何时候都更加容易。通过 Prometheus remote-write 端点以及直接嵌入 ES|QL 的原生 PromQL 支持,团队只需极少的迁移工作,即可将现有的 Grafana 仪表板和查询指向 Elastic,而无需放弃多年来构建的查询语言和工作流。

全新的迁移工具现已正式发布,可自动将 Grafana 和 Datadog 的仪表板及告警迁移到 Elastic,使用户无需从头开始,即可享受 Elasticsearch 更高的存储效率(最高可比 Prometheus 提高 2.5 倍)和更快的查询性能(最高可比 Prometheus 快 30 倍)。

在 9.5 中,全新的 ES95 编解码器( codec )在 Elasticsearch 已具备的列式指标存储高效率基础上进一步优化,将存储成本再降低约 20%,达到每个采样点约 3 字节。这意味着用户能够监控更多服务,并保留更长时间的指标数据,而无需担心成本大幅增加。

结合以代码定义仪表板( dashboards-as-code )和聊天中的仪表板( dashboards in chat ),这些更新使用户能够在统一平台上整合指标、日志和追踪数据,并在三者之间进行关联分析,以更快完成根本原因分析,同时继续使用他们已经熟悉的工作流和标准。

全面集成 AI 的完整集成方案

Elastic 最新提供的 Kubernetes 和 AWS 开箱即用集成(技术预览)意味着你只需几分钟即可从零开始实现全面监控。

Kubernetes 监控现已正式发布,并提供预配置的仪表板、告警、SLO 以及机器学习作业。

此外, Agent SkillsObservability MCP 应用使健康监控、异常检测、事件调查和问题修复能够通过任何支持 MCP 的 AI 工具完成,让 SRE 可以直接在日常工作的工具中完成这些任务。

这些完整的集成方案使团队从连接数据开始的第一刻起,就能够立即从指标数据中获得价值。

更轻松地接入云原生数据

Elastic 托管集成消除了接入云数据源的运维负担。现在,用户只需点击几下,无需部署或维护本地 agent,即可完成数据摄取并开始获得价值。

秉承 “Easy Button” 理念,我们还简化了 Kubernetes 和 AWS 的接入流程,将两者默认采用推荐的 OTel 接入路径。这意味着平台工程师和 SRE 无需在多个配置页面之间切换并做出各种配置决策,即可快速完成部署。

增强的 APM 和 LLM 可观测性

9.5 为调查服务故障的 SRE 和开发者带来了重要的易用性提升。

告警和仪表板中的依赖关系分析提供了更快的分类处理路径,通过直接在告警或自定义仪表板中展示服务拓扑图( service maps ),避免了在多个界面之间来回切换。

APM 服务健康视图进一步增强了异常展示能力,使基于机器学习的性能退化信号更容易被发现。

Elastic 针对 LLM 可观测性推出了全新的 Anthropic 集成,可轮询 Anthropic 的 Admin API,将 Claude API 平台的组织级遥测数据、 Token 使用情况、成本以及速率限制配置摄取到 Elasticsearch,并提供预构建的 Kibana 仪表板和开箱即用的告警。

直接在你的告警详情页面中识别依赖关系。

Elastic Security

Elastic Security 9.5 让分析师有更多时间进行决策,并减少需要处理的告警数量。更强大的端点防护能够在威胁产生告警之前阻止更多攻击。 Attack Discovery 会像分析师一样处理实际触发的告警,发现真正的攻击,让团队无需每天一开始就淹没在原始告警中。自动化能力贯穿整个流程,在底层触发调查并处理机械性工作,让决策始终由分析师掌控。

Alert Zero:从告警队列到已验证威胁

Alert Zero 是 SOC 版本的 Inbox Zero,意味着将告警队列缩减到真正重要的内容,由 agent 和分析师共同实现。这是团队持续努力接近的目标。它并不意味着告警数量为零,也不意味着取代分析师。

Attack Discovery 帮助 SOC 更接近 Alert Zero。现在,它会像分析师一样进行调查,通过对原始事件进行威胁搜寻、检查实体风险,并在最初触发告警之外进行关联验证,然后才将某个事件认定为攻击。因此,团队看到的是一份经过验证的攻击列表,而不是一整面原始告警墙。

当它发现规则遗漏的问题时,会生成一个 ES|QL 规则草稿来填补检测缺口,并由分析师审批后再保存。

现在,无论调查是手动启动、按照周期计划运行,还是由 Elastic Workflow 触发,每次执行都会经过相同的调查流程。

独立的告警分析工作流则从另一侧处理噪声,通过将告警分类为真实告警或误报,帮助分析师不再将数小时浪费在低可信度告警上,从而让 Attack Discovery 能够专注于调查更高质量的告警集合。

增强的端点防护

借助 Elastic Security 9.5,全新的端点能力进一步增强了防护能力,并将覆盖范围扩展到更多设备。针对攻击者利用已经签名并受信任的漏洞驱动程序进入内核的问题,我们的威胁研究团队会监控 VirusTotal、 loldrivers.io 和 Microsoft 的阻止列表等公开披露来源。

通过持续运行的流程, Elastic 会在新的驱动程序被披露后自动生成并立即部署 YARA 规则,使防护能力能够跟上威胁变化,而无需等待版本发布周期。

当由 AI 驱动的攻击能够在一分钟内从一台机器传播到下一台机器,其速度超过任何响应工作流的反应能力时,这种速度至关重要。

Windows on ARM 现已在 Elastic Defend 中获得完整支持,使 Surface 和其他基于 ARM 的笔记本电脑获得全面防护。

此外, Agent Builder 中新增的端点故障排查 skill 能够识别策略和性能问题,让团队减少在追踪端点问题上花费的时间。

覆盖整个 SOC 的自动化

Elastic Workflows 为 SOC 带来了原生自动化能力,使检测结果能够自动触发数据增强、案例创建和响应流程,无需额外购买、集成或维护独立的 SOAR。

人工仍然专注于需要判断的决策。

如果你错过了这些……

在各个版本发布之间,我们并不是停留在已有成果上。 Elastic 9.4 和 9.5 之间的这段时间一点也不平静。以下是一些重要公告的汇总,以防你错过( ICYMI ):

  • Jina AI 更新
    • jina-embeddings-v5-omni 在 v5-text 模型系列基础上扩展,提供原生图像、音频和视频支持,在单一 embedding 空间中支持近 100 种语言和全部四种模态,无需重新索引。
    • Jina On-Prem 现已面向具有严格数据驻留要求的团队提供。它将完整的 Jina AI 模型系列(例如 reader、embedding 和 reranking )打包,使其能够完全运行在你自己的硬件上,部署后实现完全隔离( air-gapped ),不会产生任何出站调用。成本固定且可预测,而不是按照 token 数量计费。 embedding 模型能够在单一 embedding 空间中跨近 100 种语言搜索文本、图像、音频和视频,并且在普通硬件上的准确性可媲美规模大得多的模型。
    • 我们已发布 jina-reranker-v3.5,这是 jina-reranker-v3 的直接替代版本。 jina-reranker-v3.5 仅有 600M 参数,但在案例法领域相比前代模型提升超过 50%,并且在医疗和金融领域的 reranking 任务中进一步提升,在长文档处理方面速度最高提升 56%。
    • 与 Qwen3-Reranker-4B 相比,后者是一款广泛使用的开源 reranker,规模超过其七倍, jina-reranker-v3.5 在通用搜索和一个结构化数据基准测试中直接胜出,并在其他场景中缩小了大部分剩余差距。
  • 远程重新索引( Reindex from remote )现已在 Elastic Cloud Serverless 中正式发布,为团队提供了一种无缝方式,可以将来自任意 Elastic Cloud Hosted 部署或 Serverless 项目的索引(无论区域在哪里)直接迁移到他们的 Serverless 环境中。该操作针对 Serverless 基础设施的实际情况进行了设计;它能够在由扩展事件或软件部署触发的节点关闭期间自动恢复,因此迁移过程无需人工干预即可持续进行。

立即从这里开始

Elastic 9.5 包含大量全新和增强功能,可帮助组织充分发挥其数据价值。

Elastic 9.5 现已在 Elastic Cloud 上提供。 Elastic Cloud 是托管式 Elasticsearch 服务,其中包含此次最新版本中的所有新功能。

本文中描述的任何功能或特性的发布时间和安排均由 Elastic 自行决定。目前尚未提供的任何功能或特性可能不会按时交付,甚至可能不会交付。

在这篇博客文章中,我们可能使用或引用了由各自所有者拥有和运营的第三方生成式 AI 工具。 Elastic 无法控制这些第三方工具,并且我们不对其内容、运行或使用承担任何责任或义务,也不对因你使用此类工具而可能产生的任何损失或损害承担责任。在使用 AI 工具处理个人、敏感或机密信息时,请谨慎操作。你提交的任何数据可能会被用于 AI 训练或其他用途。无法保证你提供的信息会被安全保管或保持机密。在使用任何生成式 AI 工具之前,你应了解其隐私实践和使用条款。

Elastic、 Elasticsearch 以及相关标识是 elasticsearch B.V. 在美国和其他国家/地区的商标、标识或注册商标。所有其他公司名称和产品名称均为其各自所有者的商标、标识或注册商标。

原文:Elastic 9.5: Columnar, VectorDB index mode & auto-calibration, and AI-driven alert triage | Elastic Blog