正则表达式:贪婪匹配与非贪婪匹配
非贪婪匹配
.*?这三个字符的组合就是非贪婪匹配,意思是匹配任意字符直到遇到第一个后面指定的字符,比如.*?_就表示匹配任意字符直到碰到下划线,还可以组合^来表示从头匹配,比如^.*?_就是从头开始匹配任意字符直到遇到第一个下划线。
举个例子
x <- c("apple_banana_cherry", "dog_cat", "red_blue_green")
# 使用 sub() 函数进行替换
result <- sub("^.*?_", "", x)
结果应该是 "banana_cherry" "cat" "blue_green"
^.*?_匹配到第一个下划线之前的所有字符,^表示从开头匹配。
贪婪匹配
.*在正则表达式中表示贪婪匹配,其中.是一个元字符,在正则表达式里,它代表除换行符之外的任意单个字符。* 是一个量词,它表示前面的元素(这里指 .)可以出现零次或多次。
所以,.* 组合起来的意思是匹配任意数量(包括零个)的任意字符。它会尽可能多地匹配字符,也就是所谓的 “贪婪匹配”。
举个例子
x <- c("apple_banana_cherry", "dog_cat", "red_blue_green")
result <- sub(".*_", "", x)
因为 sub(".*_", "", x)函数表示把指定部分替换成空字符也就是删除正则表达式匹配到的部分,后面有一个_,.*_就是匹配到最后一个_,前面的所有字符。
此时的result应该是"cherry" "cat" "green"