登录社区云,与社区用户共同成长
邀请您加入社区
ES 中每个索引段(segment)会为字段的唯一词条生成本地序数(term → 整数 ID),但聚合 / 排序需要跨段统一映射,因此 ES 会生成全局序数它是一个「全分片唯一的词条→整数 ID」映射表,基于doc_values(keyword 默认开启)构建;作用:让聚合 / 排序直接用整数 ID 运算,大幅提升性能(避免重复解析字符串);支持字段:仅keyword(默认支持)、开启fieldd
摘要:本文介绍了三种实现智能房产搜索的方法:1) 使用Python编程结合LLM调用;2) 创建定制MCP服务器;3) 无需编程的AI Agent方案。重点展示了通过Workflow创建AI Agent的完整流程,包括参数提取、地理编码、ES|QL查询构建等步骤,成功实现了自然语言查询转换为结构化搜索条件的功能。测试案例验证了该方案能有效处理"迈阿密10英里内2卧2卫、中央空调、瓷砖地板
摘要:本文探讨了在混合企业环境中实现端到端可观测性的解决方案。通过结合IBM Z Observability Connect和Elastic Observability,可以解决现代云原生应用与IBM主机系统交互时的可观测性挑战。OpenTelemetry作为标准,将主机系统纳入统一监控,消除"断裂的Trace"问题。文章详细介绍了架构实现,包括Collector、Proces
本文通过实战案例演示 Elasticsearch 审计日志分析,主要内容包括:(1)创建测试索引并写入样例数据;(2)审计日志查询方法,包括按时间倒序查询和按事件类型聚合统计;(3)重点分析 SSL 异常、合规性操作等关键事件类型及其安全含义;(4)提供特定事件类型查询和时间范围过滤的 DSL 示例。分析发现 SSL 异常事件数量异常偏高,同时合规性操作日志记录完整,建议优先调查 SSL 问题并检
本文介绍了Elasticsearch ES|QL中新增的向量搜索功能,包括对dense_vector字段的原生支持以及KNN函数和向量相似度函数的使用。通过创建包含3维向量的产品索引示例,演示了如何执行近似最近邻搜索(KNN)和精确搜索(向量相似度函数),并展示了如何结合传统过滤条件进行高效查询。文章还介绍了可选参数微调、TEXT_EMBEDDING函数等高级功能,强调ES|QL为语义搜索提供了灵
本文介绍了使用Elasticsearch和Kibana构建国家/地区指标对比地图的教程。通过ES|QL新增函数LOOKUPJOIN和ST_GEOTILE,演示了创建choropleth图层(按网络流量着色)、添加文档点图层(显示单个日志)和聚合数据图层(显示网格化统计)的步骤。特别展示了如何通过人口数据对流量指标进行标准化处理,使国家间的比较更加公平。教程详细说明了从上传地理数据、创建索引到构建地
文章摘要:Elasticsearch与Microsoft Azure AI Foundry Agent Service的深度整合解决了企业级AI应用的核心挑战——如何确保智能代理基于专有数据生成可信响应。该集成通过两种协议实现:1)MCP协议让Elasticsearch作为知识库提供数据支撑;2)A2A协议支持不同代理间的协作工作流。这种技术架构既保证了响应准确性,又实现了复杂任务编排,使企业能够
摘要:Elasticsearch团队通过实验优化AIagent工作流中的索引选择机制,发现仅依靠索引名称准确率仅77%。通过测试结合索引描述、字段名和语义搜索等方法,最终采用混合搜索筛选候选索引再交由LLM决策的方案,将准确率提升至90%以上。该研究证实了数据驱动决策的价值,并揭示了可搜索索引元数据的重要性,为构建更智能的Agent工具奠定了基础。
《搜索百科》专栏首篇详解Apache Lucene:搜索技术的基石 Lucene是由Doug Cutting于1997年开发的Java全文搜索引擎库,1999年首次发布,2001年加入Apache基金会。作为底层搜索库,它提供了强大的索引查询、分词、相关性评分等功能,是Elasticsearch、Solr等现代搜索引擎的核心引擎。 25年来,Lucene凭借高性能检索、可扩展分析链和稳定版本线保持
Elastic官方发布了elastic-esql gem工具,帮助开发者用Ruby代码构建Elasticsearch的ES|QL查询。该工具采用链式调用方式,支持常见查询操作(如LIMIT、SORT等),并能转换为标准ES|QL语句。既可与Elasticsearch Ruby客户端配合使用,也可作为独立工具使用。目前以技术预览版发布,支持自定义查询字符串,开发者可通过Gemfile安装gem 'e
IK分词器(IK Analyzer)是Elasticsearch中广泛使用的中文分词插件,专门针对中文文本进行高效的分词处理。
本文介绍了如何在本地部署阿里Qwen3大模型并连接到Elasticsearch实现RAG应用。主要内容包括: 创建Elasticsearch API key获取访问凭证 编写Python代码实现RAG流程,包括Elasticsearch查询、上下文构建和Qwen3模型调用 配置环境变量和证书,确保代码正常运行 测试Qwen3模型接口工作正常 修改代码适配最新Elasticsearch版本的数据结构
本文详细介绍了如何安装并配置MCPServer来连接Elasticsearch数据库,实现通过自然语言对话查询数据。主要内容包括:1)安装Elasticsearch和Kibana;2)获取Elasticsearch API密钥;3)下载并配置MCP服务器;4)使用Claude Desktop应用连接MCP服务器;5)通过实例演示了索引查询、数据统计等操作。该方法实现了智能代理与Elasticsea
总结:可以看到我们使用 ElasticsearchRepository(也就是 JPA) 进程 Elasticsearch 的数据增删改查就像使用 MySQL 一样简单,但我在尝试使用较为复杂的查询的时候,ElasticsearchRepository 相关的方法提示已经过期,下一篇我们将分享使用 ElasticsearchRestTemplate 实现复杂查询,希望本篇的分享可以帮助到有需要的朋
解释如何使用和来连接 Elasticsearch 中的两个索引。Elasticsearch 拥有丰富的新功能,帮助你为自己的使用场景构建最佳搜索解决方案。深入阅读我们的,了解更多信息,开始,或立即在上尝试 Elastic。在 Elasticsearch 中,连接两个索引不像传统 SQL 数据库那样直接。然而,可以通过 Elasticsearch 提供的一些技术和功能实现类似的效果。本文将深入介绍在
在Unity3D中,Lua的集成主要通过第三方插件实现,常见的有以及基于C++的LuaBridge等。这些工具通过桥接C#与Lua,实现热更新、逻辑分层和灵活的脚本控制。对惹,这里有一个游戏开发交流小组,希望大家可以点击进来一起交流一下开发经验呀!Unity3D与Lua的集成需选择合适的插件(如SLua/toLua/xLua),并通过C#与Lua的双向交互实现灵活开发。环境配置:正确初始化Lua虚
在这篇博客中,我们将向你展示如何配置和自定义 LangGraph Retrieval Agent 模板与 Elasticsearch,以构建一个强大的 RAG 工作流,实现高效的数据检索和由 AI 驱动的响应。本博客重点介绍如何使用 LangGraph Studio 和 LangGraph CLI 运行并自定义 LangChain Retrieval Agent Template。该模板为构建检索
探索 Elasticsearch 堆内存使用情况和 JVM 垃圾回收,包括最佳实践以及在堆内存使用过高或 JVM 性能不佳时的解决方法。堆内存大小是分配给 Elasticsearch 节点中 Java 虚拟机的 RAM 数量。从 7.11 版本开始,Elasticsearch 默认会根据节点的角色和总内存自动设置 JVM 堆内存大小。对于大多数生产环境,推荐使用默认配置。然而,如果你希望手动设置
不可否认的是:生成式 AI(- GenAI)正在重塑 IT 的未来(甚至可能是世界的未来)。根据 Forrester 2024 年的脉搏调查,67% 的 AI 决策者表示,他们的组织计划在未来一年增加对生成式 AI 的投资。那么,什么只是生成式 AI 的炒作,什么又值得长期投资呢?IT 和商业领导者如何区分事实与虚构?这种热潮带来了兴奋和怀疑。人们对生成式 AI 如何收集数据、其安全措施以及其对
将多值字段转换为字符串通配符模式匹配使用全文本功能,将更新 _score 元数据字段条件加权加权最近内容组合评分基于自定义评分进行过滤。
今天,我们很高兴地宣布 Elastic 9.0 和 8.18 的正式发布!Elastic 9.0 基于 Lucene 10.0,标志着 Elasticsearch、Elastic 搜索 AI 平台以及其核心解决方案 Elastic Observability 和 Elastic Security 的一次重大升级。此版本带来了更快的性能和更高的效率,得益于 Lucene 10.0 的内置改进,如更
向量搜索是当前的热门话题,但大多数讨论集中在密集向量上:用于机器学习和神经搜索的紧凑型数值表示。而稀疏向量则采用了不同的路径。与紧密压缩数据的密集向量不同,稀疏向量以更具可解释性和结构化的格式存储信息,通常包含大量的零。虽然没有那么受关注,但在合适的场景下,它们的能力是非常强大的。💡 趣味小知识:稀疏向量和倒排索引都利用稀疏性来高效地表示和检索信息。在 Elasticsearch 中,你可以使用
AI 会开始取代网络安全工作吗?不会,但它正在从根本上改变这些工作。正迅速成为日常安全工作流程中的一个重要组成部分。那么,它是合作伙伴还是竞争对手?GenAI 技术在安全堆栈几乎每个方面的广泛应用,整体上帮助安全团队更高效地应对威胁。GenAI 使安全从业者能够访问并分析他们原本无法获得的数据,从而使他们的工作比以往任何时候都更具影响力。然而,与此同时,GenAI 也扩展了攻击面 —— 无论是通过
Elasticsearch AI Assistant 是基于生成式人工智能(GenAI)和大型语言模型(LLM)技术构建的智能运维解决方案。该产品深度融合 Elasticsearch 底层能力,通过自然语言交互与上下文感知两大核心特性,为可观测性分析、安全运维管理及数据智能处理提供一站式解决方案。深度集成:直接调用 Elasticsearch API 实现集群实时状态诊断,支持动态生成可视化数据看
Elasticsearch 刚刚 15 岁了!回顾过去 15 年的索引和搜索,并展望未来 15 年的相关内容。Elasticsearch 刚刚成立 15 周年。一切始于 2010 年 2 月的一篇(带有标志性的 “You Know, for Search - 你知道,用于搜索” 标语)、和,当时的版本号是 0.4.0。让我们回顾一下过去 15 年的索引和搜索,并展望未来 15 年的发展。
Logstash 是一种广泛使用的 Elastic Stack 工具,用于实时处理大量日志数据。它充当高效的数据管道,将来自各种来源的信息集成到单一结构化流中。其主要功能是可靠地执行数据提取、转换和加载。Logstash 具有多种优势,尤其是其在支持多种类型的输入、过滤器和输出方面的多功能性,可与各种来源和目的地集成。它实时处理数据,捕获和转换信息。它与 Elastic Stack(尤其是 Ela
以某知名医疗 AI 公司开发的一款智能影像诊断系统为例,该项目旨在利用人工智能技术提高医学影像诊断的准确性和效率。项目背景源于医疗领域对精准诊断的迫切需求,传统的医学影像诊断主要依赖医生的人工判读,存在诊断效率低、主观性强等问题,容易导致误诊和漏诊。随着医疗影像技术的不断发展,如 CT、MRI 等设备的广泛应用,产生了大量的医学影像数据,为人工智能技术的应用提供了数据基础。该项目的目标是开发一款能
混合搜索是一种结合了不同搜索方法(如传统词汇匹配和语义搜索)的技术。当用户知道确切的单词时,词汇搜索非常有用。这种方法将找到相关文档,并使用TF-IDF以合理的方式对其进行排序,这意味着:你搜索的术语在数据集中越常见,它对分数的贡献就越小;在某个文档中越常见,它对分数的贡献就越大。更多有关 TF-IDF 的阅读,请参阅文章 “Elasticsearch:分布式计分但是,如果查询中的单词不在文档中,
细心的开发者如果已经阅读我前两天发布的文章 “Elastic 8.17:Elasticsearch logsdb 索引模式、Elastic Rerank 等”,你就会发现在 8.17 的发布版中,有一个重要的功能发布。那就是 ES|QL 开始支持全文搜索了。在今天的文章中我们来尝试一下。ES|QL 中新的 MATCH 和查询字符串 (QSTR) 函数的技术预览使日志搜索更加轻松直观。MATCH
随着 Elastic Cloud 提供可观察性、安全性和搜索等解决方案,我们将使用 Elastic Cloud 的用户范围从完整的运营团队扩大到包括数据工程师、安全团队和顾问。作为 Elastic 支持代表,我很乐意与各种各样的用户和用例互动。随着受众的扩大,我看到了更多关于管理资源分配的问题,特别是对分配健康状况进行故障排除和避免断路器的问题。我明白了!当我开始使用 Elasticsearc
Lucene 和 Elasticsearch 中更好的二进制量化 (BBQ)。嵌入模型输出 float32 向量,通常对于高效处理和实际应用来说太大。Elasticsearch 支持 int8 标量量化,以减小向量大小,同时保持性能。其他方法会降低检索质量,并且不适用于实际使用。
许多电子商务网站都希望增强其食谱搜索体验。正确使用语义搜索可以让客户根据更自然的查询(例如 “something for Valentine's Day - 情人节的礼物” 或 “Thanksgiving meals. - 感恩节大餐”)快速找到所需的食材。在本文中,我们将演示如何使用 Elasticsearch 实现支持此类查询的语义搜索。我们将配置一个索引来存储超市的食材和产品目录,并演示如何
Elasticsearch 是一款功能强大的开源搜索引擎,可用于全文搜索、分析和数据可视化。传统上,Elasticsearch 以其执行基于关键字/词汇的搜索的能力而闻名,其中文档基于精确或部分关键字匹配进行匹配。然而,Elasticsearch 已经发展到支持语义搜索 —— 一种专注于理解单词和短语背后的含义,而不仅仅是匹配关键字的方法。Elasticsearch 中的语义搜索可实现更直观和上下
二进制编码是现代应用中的一项重要技术,尤其是在物联网设备监控等领域,这些领域需要持续处理大量二进制传感器数据或操作标志。高效管理和搜索此类数据对于实时分析和决策至关重要。为了实现这一点,按位匹配是一种基于二进制值进行过滤的强大工具,可以实现精确的数据提取。通过正确的数据建模,Elasticsearch 不仅支持按位匹配,而且性能极佳。在撰写本文时,Elasticsearch 没有用于按位匹配的原生
影响增量同步性能的主要因素是什么?简而言之,就是提取的原始数据量。对于 Sharepoint Online 连接器,有一种特殊的逻辑可以通过增量 API 获取较少的数据。这节省了大量时间,因为增量 API 允许连接器不提取未更改的文件。文件往往很大,因此不下载和提取它们将节省大量时间。对于其他连接器,增量同步是通用的 - 它只是在将文档提取到 Elasticsearch 之前检查文档时间戳 - 如
我相信您同意,我们无法忽视生成式人工智能 (GenAI),因为我们不断被有关大型语言模型 (LLMs) 的主流新闻轰炸。你很可能已经尝试过 ChatGPT,甚至可能一直将其作为助手使用。我认为很多人对 GenAI 革命有一个基本疑问,即这些模型的明显智能来自哪里。在本文中,我将尝试用简单的术语解释生成式文本模型的工作原理,而不使用高级数学,以帮助你将它们视为计算机算法而不是魔法。
本文向你展示如何将 Microsoft 高效的与 Elastic 的语义搜索功能相结合,以创建智能的对话式订购系统。我们将介绍如何在 Azure AI Studio 上部署 phi-3、设置 Elastic 以及为一家意大利餐厅构建应用程序。4 月,Microsoft 宣布推出其最先进的系列,这些模型是经济高效的模型,经过优化,可在资源受限的条件下以低延迟执行,非常适合大规模/实时任务。这两个模型
自一年多前第一次发布此博客以来,发生了很多变化,我们在本博客中涵盖了很多内容。你从云 API 密钥开始,创建了 Elasticsearch Serverless 项目,生成了云 API 密钥,配置了 Open Web Crawler,爬取了三个 Elastic Lab 站点,对长文本进行了分块,生成了嵌入,测试了 RAG 应用程序的最佳聊天设置,并导出了代码!UI 在哪里,Vestal?请关注第二
在最近的博客文章中,我们宣布了支持 Elastic Cloud Serverless 产品的无状态架构。通过将持久性保证和复制卸载到对象存储(例如 Amazon S3),我们获得了许多优势和简化。从历史上看,Elasticsearch 依靠本地磁盘持久性来确保数据安全并处理陈旧或孤立的节点。在本博客中,我们将讨论无状态的数据持久性保证,包括我们如何使用安全检查隔离新的写入和删除,以防止陈旧节点不安
我们如何衡量人工智能对政府的影响?毫无疑问,人工智能将为运营流程和决策带来的好处已被广泛讨论 —— 从自动化工作流程到节省成本再到减少重复工作。但对于以服务公众为目标的组织来说,人工智能的这些好处不仅限于业务指标,例如效率或收入增长。相反,人工智能带来的潜在效率和成本节约可以开辟空间和资源,用于提供有意义的公共服务,改善全球人民的生活质量。这听起来可能过于简单和理想化 —— 但它已经发生了。
作者:阿里云魏子珺【AI搜索 TechDay】是 Elastic 和阿里云联合主办的 AI 技术 Meetup 系列,聚焦企业级 AI 搜索应用和开发者动手实践,旨在帮助开发者在大模型浪潮下升级 AI 搜索,助力业务增长。本次分享聚焦于阿里云 ES 平台上的 AI 搜索实践与探索。经过团队研究,我们已在多个方向取得实质性进展。我先简要概述 ES 在 AI 领域的核心特性,提供一个概览性的理解。
多年来,Elasticsearch 一直具有强大的地理空间搜索和分析功能,但其 API 与典型的 GIS 用户习惯的 API 截然不同。在过去的一年中,我们添加了 ES|QL 查询语言,这是一种管道查询语言,与 SQL 一样简单,甚至更简单。它特别适合 Elastic 擅长的搜索、安全性和可观察性用例。我们还在 ES|QL 中添加了对地理空间搜索和分析的支持,使其使用起来更加容易,尤其是对于来自
这是一系列博客文章中的第一篇,讨论如何在更好地理解 BEIR 基准的背景下考虑评估你自己的搜索系统。我们将介绍具体的技巧和技术,以便在更好地理解 BEIR 的背景下改进你的搜索评估流程。我们还将介绍导致评估可靠性降低的常见陷阱。最后,我们注意到 LLM 为搜索工程师提供了一个强大的新工具,我们将通过示例展示如何使用它们来帮助评估搜索。
从 Elasticsearch 8.13 开始,我们提供了原生集成到 Elasticsearch 中的学习排名 (learning to rank - LTR) 实现。LTR 使用经过训练的机器学习 (ML) 模型为你的搜索引擎构建排名功能。通常,该模型用作第二阶段重新排名器,以提高由更简单的第一阶段检索算法返回的搜索结果的相关性。这篇博文将解释此新功能如何帮助提高文本搜索中的文档排名以及如何在