ElasticSearch之Ingest Pipeline和Painless Script

🕗 发布于 2024-03-25 00:35 elasticsearch ingest pipeline painless script

写在前面

如果是我们需要在写入文档或者是返回文档时，进行修改字段值，或者增加字段等操作时，就可以考虑使用ingest pipeline和painless script。如下的需求：
在这里插入图片描述

1:ingest pipeline

在es 5中引入了一种新的节点类型ingest node，ingest node具备对数据预处理的能力，使用的就是ingest pipeline。ingest pipeline可以拦截index或者时bulk的请求，对数据处理后重新返回回去，最终保存通过ingest pipeline处理后的数据，如下图：
在这里插入图片描述
通过一组processor来处理数据，可以使用内置的processor，也可以使用插件的方式来自定义processor，其中内置的processor列表如下：

另外es提供了simulate的API来模拟ingest pipeline的执行效果：
在这里插入图片描述

接下来我们看实际的例子。

1.1：实例

定义一个pipeline，方便使用

当然也可以直接写pipeline来用。

# 为ES添加一个 Pipeline
PUT _ingest/pipeline/blog_pipeline
{
  "description": "a blog pipeline",
  "processors": [
    {
      "split": {
        "field": "tags",
        "separator": ","
      }
    },
    {
      "set": {
        "field": "views",
        "value": 0
      }
    }
  ]
}

通过slit分割tags，通过set给文档增加一个字段views，值为0。

查看定义的pipeline
测试pipeline
正式使用之前先来测试一下：
不使用pipeline新增数据

PUT tech_blogs/_doc/1
{
  "title": "Introducing big data......",
  "tags": "hadoop,elasticsearch,spark",
  "content": "You konw, for big data"
}

使用pipeline新增数据

PUT tech_blogs/_doc/2?pipeline=blog_pipeline
{
  "title": "Introducing cloud computering",
  "tags": "openstack,k8s",
  "content": "You konw, for cloud"
}

看下新增的数据：
在这里插入图片描述

update_by_query使用pipeline重建本索引

因为pipeline处理后插入的数据底层是ArrayList类型，无法再执行split操作，想要重建索引的话，只需要将已经被pipeline处理过数据过滤掉即可，如果是包含views就是处理过的，如下：

POST tech_blogs/_update_by_query?pipeline=blog_pipeline
{
  "query": {
    "bool": {
      "must_not": {
        "exists": {
          "field": "views"
        }
      }
    }
  }
}

在这里插入图片描述

1.2：和logstash的比较

在这里插入图片描述

2:painless script

palinless script载es5引入，支持Java，其可实现功能如下：

1:对写入的文档增加，删除，修改字段，可配合ingest pipeline使用
2：对返回的文档增加，删除，修改字段（此时不会影响数据库中的文档）
3：function score,基于相关度评分，按照新规则生成新评分，从而影响最终文档的排序结果：https://dongyunqi.blog.csdn.net/article/details/136341656

2.1：painless 上下文

需要需要在painless脚本中访问文档数据，执行具体的操作，所以就需要对文档的访问，而对文档的访问在不同的上下文中是不一样的，主要有如下三种：

1:在pipeline中，通过ctx.fieldname的方式来访问
2:在update中通过ctx_source.fieldname的方式来访问
3：在search和aggregation中通过dock[fieldname]的方式来访问

2.2：实例

2.2.1：pipeline

使用splitprocesscor将字符串分割为字符串，使用painless scrit增加属性content_length，使用setprocessor增加属性views并设置值为0。

POST _ingest/pipeline/_simulate
{
  "pipeline": {
    "description": "to split blog tags",
    "processors": [
      {
        "split": {
          "field": "tags",
          "separator": ","
        }
      },
      {
        "script": {
          "source": """
          if(ctx.containsKey("content")){
            ctx.content_length = ctx.content.length();
          }else{
            ctx.content_length=0;
          }


          """
        }
      },

      {
        "set":{
          "field": "views",
          "value": 0
        }
      }
    ]
  },

  "docs": [
    {
      "_index":"index",
      "_id":"id",
      "_source":{
        "title":"Introducing big data......",
  "tags":"hadoop,elasticsearch,spark",
  "content":"You konw, for big data"
      }
    },


    {
      "_index":"index",
      "_id":"idxx",
      "_source":{
        "title":"Introducing cloud computering",
  "tags":"openstack,k8s",
  "content":"You konw, for cloud"
      }
    }

    ]
}

在这里插入图片描述

2.2.2：update

准备测试数据

DELETE tech_blogs
PUT tech_blogs/_doc/1
{
  "title":"Introducing big data......",
  "tags":"hadoop,elasticsearch,spark",
  "content":"You konw, for big data",
  "views":0
}

将views增加100

POST tech_blogs/_update/1
{
  "script": {
    "source": "ctx._source.views += params.new_views",
    "params": {
      "new_views": 100
    }
  }
}

GET tech_blogs/_search

在这里插入图片描述

使用预定义painless脚本的方式更新
预定义painless脚本，并通过入参的方式，给views+1000。

#保存脚本在 Cluster State
POST _scripts/update_views
{
  "script": {
    "lang": "painless",
    "source": "ctx._source.views += params.new_views"
  }
}

POST tech_blogs/_update/1
{
  "script": {
    "id": "update_views",
    "params": {
      "new_views": 1000
    }
  }
}

GET tech_blogs/_search

在这里插入图片描述

2.2.3：search

返回结果中增加rnd_views字段，其中以views字段并给其加上1000以内的随机数获取作为值：

GET tech_blogs/_search
{
  "script_fields": {
    "rnd_views": {
      "script": {
        "lang": "painless",
        "source": """
          java.util.Random rnd = new Random();
          doc['views'].value+rnd.nextInt(1000);
"""
      }
    }
  },
  "query": {
    "match_all": {}
  }
}

在这里插入图片描述

写在后面

参考文章列表

原文地址：https://blog.csdn.net/wang0907/article/details/136699246

免责声明：本站文章内容转载自网络资源，如本站内容侵犯了原著者的合法权益，可联系本站删除。更多内容请关注自学内容网（zxcms.com）！

上一篇：Elasticsearch面试系列-02
下一篇：带3090显卡的Linux服务器上部署SDWebui

富格林：积攒经验阻挠欺诈套路
富格林指出，现货黄金这些年可谓是表现出色，相信上车现货黄金的投资者，都或多或少分得一杯满意的羹。注意调整交易的操作节奏。获利的关键是对操作节奏的有效把控，倘若过于频繁地出入场，只会让自己对市场的变化失
阅读更多2024-09-21
【PGCCC】PG持久化机制与故障恢复——让你的数据库“永不崩塌”！
WAL是PostgreSQL的核心持久化机制，其原理非常简单：先写日志，再修改数据。这意味着当你进行任何数据库操作时，PostgreSQL不会立即修改数据文件，而是先将变更记录到一个日志文件中，之后再
阅读更多2024-09-21
NLP（二）-文本表示
词嵌入（word embedding）是一种词的向量化表示方式，该方法将词语映射为一个实数向量，同时保留词语之间语义的相似性和相关性。例如：我们用一个四维向量来表示man，Women，King，Que
阅读更多2024-09-21
C++ | Leetcode C++题解之第421题数组中两个数的最大异或值
C++ | Leetcode C++题解之第421题数组中两个数的最大异或值
阅读更多2024-09-21
python文字转wav音频
【代码】python文字转wav音频。
阅读更多2024-09-21
字符串函数的使用与模拟(2)——C语言内存函数
C语言内存函数是一组用于直接操作计算机内存的内置函数。使用时要包含头文件。
阅读更多2024-09-21
203. 移除链表元素
203移除链表元素，数据结构，单链表
阅读更多2024-09-21
数据结构应试-树和二叉树
树内各结点度的最大值，即上图 D 结点的度就是此树的度叶子：度为 0 的节点称为叶子或终端节点结点的层次和树的深度。
阅读更多2024-09-21
发现编程的全新境界——明基RD280U显示器使用体验
经过一段时间的使用，我对明基RD280U这款显示器的整体表现非常满意。无论是更广的视野、更舒适的视觉体验，还是在编程中的高效工作流，明基RD280U都完全满足了我作为程序员的需求。如果你正在寻找一款能
阅读更多2024-09-21
HarmonyOS学习(十三)——数据管理(二) 关系型数据库
关系型数据库（Relational Database,RDB）是一种基于关系模型来管理数据的数据库，HarmonyOS关系数据库是基于Sqlite组件提供了一套完整的对本地数据库进行管理的机制，对外提
阅读更多2024-09-21

ElasticSearch之Ingest Pipeline和Painless Script

写在前面

1:ingest pipeline

1.1：实例

1.2：和logstash的比较

2:painless script

2.1：painless 上下文

2.2：实例

2.2.1：pipeline

2.2.2：update

2.2.3：search

写在后面

参考文章列表

相关文章