脚本之家,脚本语言编程技术及教程分享平台!
分类导航

Python|VBS|Ruby|Lua|perl|VBA|Golang|PowerShell|Erlang|autoit|Dos|bat|

服务器之家 - 脚本之家 - Golang - Golang 正则匹配效率详解

Golang 正则匹配效率详解

2021-05-29 00:58无痕空间 Golang

这篇文章主要介绍了Golang 正则匹配效率详解,具有很好的参考价值,希望对大家有所帮助。一起跟随小编过来看看吧

最近有个小需求,校验IMEI是否为15位纯数字(是否合法)

以下是正则匹配

 

与自己实现的简单验证方式进行压测

?
1
2
3
4
5
6
7
8
9
10
11
12
13
14
15
16
17
18
19
20
21
22
23
24
25
26
27
28
29
30
31
32
33
34
35
36
37
package main
import (
    "regexp"
    "testing"
)
func BenchmarkIsDigitalRegexp(b *testing.B) {
    for i := 0; i < b.N; i++ {
        _ = isDigitalRegexp("358901806972417")
    }
}
func BenchmarkIsDigital(b *testing.B) {
    for i := 0; i < b.N; i++ {
        _ = isDigital("358901806972417")
    }
}
func isDigitalRegexp(imei string) bool {
    if ok, _ := regexp.Match("^[0-9]{15}$", []byte(imei)); ok {
        return true
    }else {
        return false
    }
}
func isDigital(imei string) bool {
    n := len(imei)
    if n == 15 {
        for i := 0; i < n; i++ {
            if imei[i] >= 48 && imei[i] <= 57 {
                continue
            }else {
                return false
            }
        }
    }else {
        return false
    }
    return true
}

压测结果:

?
1
2
3
4
5
6
7
8
C:\Users\M709FJSA\go\src\pprof_demo\re>go test -bench=. -benchmem
goos: windows
goarch: amd64
pkg: pprof_demo/re
BenchmarkIsDigitalRegexp-12       300000              4644 ns/op            6450 B/op         70 allocs/op
BenchmarkIsDigital-12           200000000                9.48 ns/op            0 B/op          0 allocs/op
PASS
ok      pprof_demo/re   4.577s

很明显,正则需要重新分配内存较多,从pprof生成图也可以看出,正则调用关系错综复杂

Golang 正则匹配效率详解

补充:Golang —— 正则表达式

正则表达式是一种进行模式匹配和文本操纵的复杂而又强大的工具。虽然正则表达式比纯粹的文本匹配效率低,但是它却更灵活。

按照它的语法规则,随需构造出的匹配模式就能够从原始文本中筛选出几乎任何你想要得到的字符组合。

Go语言通过regexp标准包为正则表达式提供了官方支持,如果你已经使用过其他编程语言提供的正则相关功能,那么你应该对Go语言版本的不会太陌生,但是它们之间也有一些小的差异,因为Go实现的是RE2标准,除了\C。

其实字符串处理我们可以使用strings包来进行搜索(Contains、Index)、替换(Replace)和解析(Split、Join)等操作,但是这些都是简单的字符串操作,他们的搜索都是大小写敏感,而且固定的字符串,如果我们需要匹配可变的那种就没办法实现了,当然如果strings包能解决你的问题,那么就尽量使用它来解决。

因为他们足够简单、而且性能和可读性都会比正则好。

正则匹配规则图

 

详细请参考官方文档

Golang 正则匹配效率详解

简单的正则表达式

 

1. 匹配任意类型

?
1
2
3
4
5
6
7
8
9
10
11
buf := "abc azc a7c aac 888 a9c tac"
// 1. 解释规则
reg := regexp.MustCompile(`a.c`) // 这里会解析正则表达式,成功就返回解释器(. ——> 除\n外任意字符)
if reg == nil { // 解释失败
    fmt.Println("MustCompile err")
    return
}
// 2. 根据规则提取关键信息
res :=  reg.FindAllStringSubmatch(buf, -1) //-1表示匹配所有的
// res :=  reg.FindAllStringSubmatch(buf, 1) //1表示匹配一个
fmt.Println("res = ", res)

执行结果:

?
1
res =  [[abc] [azc] [a7c] [aac] [a9c]]

2. 使用 […] (字符集) 匹配[0-9]之间的数值

?
1
2
3
4
5
6
7
8
9
10
11
12
13
buf := "abc azc a7c aac 888 a9c  tac"
 
  //1) 解释规则, 它会解析正则表达式,如果成功返回解释器
  reg1 := regexp.MustCompile(`a[0-9]c`)
 
  if reg1 == nil { //解释失败,返回nil
      fmt.Println("MustCompile err")
      return
  }
 
  //2) 根据规则提取关键信息
  result1 := reg1.FindAllStringSubmatch(buf, -1)
  fmt.Println("result1 = ", result1)

执行结果:

?
1
result1 =  [[a7c] [a9c]]

3. 使用 \d 匹配[0-9]之间的数值

?
1
2
3
4
5
6
7
8
9
10
11
12
buf := "abc azc a7c aac 888 a9c  tac"
 
  //1) 解释规则, 它会解析正则表达式,如果成功返回解释器
  reg1 := regexp.MustCompile(`a\dc`)
  if reg1 == nil { //解释失败,返回nil
      fmt.Println("MustCompile err")
      return
  }
 
  //2) 根据规则提取关键信息
  result1 := reg1.FindAllStringSubmatch(buf, -1)
  fmt.Println("result1 = ", result1)

执行结果:

?
1
result1 =  [[a7c] [a9c]]

4.匹配小数

?
1
2
3
4
5
6
7
8
9
10
buf := "3.14 456 adsc as23d 1.23 3. 9.99 1lsa23d 0.08 0.00  "
// 解释正则表达式
reg := regexp.MustCompile(`\d+\.\d+`) // +表示匹配前一个字符的一次或者多次
if reg == nil {
 fmt.Println("MustCompile err")
 return
}
// 提取关键信息
res := reg.FindAllStringSubmatch(buf, -1)
fmt.Println("res = ", res)

执行结果:

?
1
res =  [[3.14] [1.23] [9.99] [0.08] [0.00]]

5.匹配信息中某关键字并过滤带标签的

?
1
2
3
4
5
6
7
8
9
10
11
12
13
14
15
16
17
18
19
20
21
22
23
24
25
26
27
28
29
30
31
32
33
34
35
36
37
38
39
40
41
42
43
44
45
// ` ` 是原生字符串
buf := `
        <!DOCTYPE html>
        <html lang="zh-CN">
        <head>
            <title>Go语言标准库文档中文版 | Go语言中文网 | Golang中文社区 | Golang中国</title>
            <meta name="viewport" content="width=device-width, initial-scale=1, maximum-scale=1.0, user-scalable=no">
            <meta http-equiv="X-UA-Compatible" content="IE=edge, chrome=1">
            <meta charset="utf-8">
            <link rel="shortcut icon" href="/static/img/go.ico" rel="external nofollow" >
            <link rel="apple-touch-icon" type="image/png" href="/static/img/logo2.png" rel="external nofollow" >
            <meta name="author" content="polaris <polaris@studygolang.com>">
            <meta name="keywords" content="中文, 文档, 标准库, Go语言,Golang,Go社区,Go中文社区,Golang中文社区,Go语言社区,Go语言学习,学习Go语言,Go语言学习园地,Golang 中国,Golang中国,Golang China, Go语言论坛, Go语言中文网">
            <meta name="description" content="Go语言文档中文版,Go语言中文网,中国 Golang 社区,Go语言学习园地,致力于构建完善的 Golang 中文社区,Go语言爱好者的学习家园。分享 Go 语言知识,交流使用经验">
        </head>
            <div>和爱好</div>
            <div>哈哈
            你在吗
            不在
            </div>
            <div>测试</div>
            <div>你过来啊</div>
        
        <frameset cols="15,85">
            <frame src="/static/pkgdoc/i.html">
            <frame name="main" src="/static/pkgdoc/main.html" tppabs="main.html" >
            <noframes>
            </noframes>
        </frameset>
        </html>
        `
// 解释正则表达式
reg := regexp.MustCompile(`<div>(?s:(.*?))</div>`) // s用来处理换行情况
if reg == nil {
    fmt.Println("MustCompile err")
    return
}
// 提取关键字
res := reg.FindAllStringSubmatch(buf, -1)
// fmt.Println("res = ", res)
// 过滤<> </>
for _, text := range res {
    //fmt.Println("text[0] = ", text[0]) // 带<> </>的
    fmt.Println("text[1] = ", text[1]) //  不带<> </> 的
}

执行结果:

?
1
2
3
4
5
6
7
text[1] =  和爱好
text[1] =  哈哈
    你在吗
    不在
    
text[1] =  测试
text[1] =  你过来啊

PS:推荐两款在线正则表达式工具

正则表达式在线测试工具 https://tool.zzvips.com/t/regex/

在线正则表达式生成器 https://tool.zzvips.com/t/regcode/

以上为个人经验,希望能给大家一个参考,也希望大家多多支持服务器之家。如有错误或未考虑完全的地方,望不吝赐教。

原文链接:https://blog.csdn.net/weixin_40943560/article/details/94595733

延伸 · 阅读

精彩推荐
  • Golanggo语言制作端口扫描器

    go语言制作端口扫描器

    本文给大家分享的是使用go语言编写的TCP端口扫描器,可以选择IP范围,扫描的端口,以及多线程,有需要的小伙伴可以参考下。 ...

    脚本之家3642020-04-25
  • GolangGolang中Bit数组的实现方式

    Golang中Bit数组的实现方式

    这篇文章主要介绍了Golang中Bit数组的实现方式,具有很好的参考价值,希望对大家有所帮助。一起跟随小编过来看看吧...

    天易独尊11682021-06-09
  • GolangGolang通脉之数据类型详情

    Golang通脉之数据类型详情

    这篇文章主要介绍了Golang通脉之数据类型,在编程语言中标识符就是定义的具有某种意义的词,比如变量名、常量名、函数名等等,Go语言中标识符允许由...

    4272021-11-24
  • Golanggolang的httpserver优雅重启方法详解

    golang的httpserver优雅重启方法详解

    这篇文章主要给大家介绍了关于golang的httpserver优雅重启的相关资料,文中通过示例代码介绍的非常详细,对大家的学习或者工作具有一定的参考学习价值,...

    helight2992020-05-14
  • Golanggolang 通过ssh代理连接mysql的操作

    golang 通过ssh代理连接mysql的操作

    这篇文章主要介绍了golang 通过ssh代理连接mysql的操作,具有很好的参考价值,希望对大家有所帮助。一起跟随小编过来看看吧...

    a165861639710342021-03-08
  • Golanggo日志系统logrus显示文件和行号的操作

    go日志系统logrus显示文件和行号的操作

    这篇文章主要介绍了go日志系统logrus显示文件和行号的操作,具有很好的参考价值,希望对大家有所帮助。一起跟随小编过来看看吧...

    SmallQinYan12302021-02-02
  • Golanggolang json.Marshal 特殊html字符被转义的解决方法

    golang json.Marshal 特殊html字符被转义的解决方法

    今天小编就为大家分享一篇golang json.Marshal 特殊html字符被转义的解决方法,具有很好的参考价值,希望对大家有所帮助。一起跟随小编过来看看吧 ...

    李浩的life12792020-05-27
  • Golanggolang如何使用struct的tag属性的详细介绍

    golang如何使用struct的tag属性的详细介绍

    这篇文章主要介绍了golang如何使用struct的tag属性的详细介绍,从例子说起,小编觉得挺不错的,现在分享给大家,也给大家做个参考。一起跟随小编过来看...

    Go语言中文网11352020-05-21