1. 概述
String 对象是 JavaScript 原生提供的三个包装对象之一,用来生成字符串的包装对象。
var s1 = 'abc';
var s2 = new String('abc');
typeof s1 // "string"
typeof s2 // "object"
s2.valueOf() // "abc"
valueOf
方法返回的就是它所包装的那个字符串。
实际上,字符串的包装对象是一个类似数组的对象
new String("abc")
// String {0: "a", 1: "b", 2: "c", length: 3}
除了用作构造函数,String 函数还可以当作工具方法使用,将任意类型的值转为字符串。
String(true) // "true"
String(5) // "5"
上面代码将布尔值 ture
和数值 5
,分别转换为字符串。
属于内部机制
实际上,在读取字符串值来执行某个方法或属性时,会内部创建一个包装对象,来执行该方法,执行之后销毁该包装对象。
var str = 'ab';
str.length //=> 2 实际上是 new String(str).length
// 下面操作也是同样的原理
str[0] //=> 'a'
str[1] //=> 'b'
由于字符串是基本类型,所以所有字符串的方法都不会改变原来的字符串,而是会创建一个副本返回
2. length
length
属性返回字符串的长度。字符串的这个属性是只读的,修改它不会起任何作用。
'abc'.length // 3
3. 字符与码值方法
3.1 String.fromCharCode()
String 对象提供的静态方法(即定义在对象本身,而不是定义在对象实例的方法),主要是 fromCharCode()
。该方法的参数是一系列 Unicode 码点,返回对应的字符串。
String.fromCharCode(104, 101, 108, 108, 111)
// "hello"
上面代码中,fromCharCode
方法接受 5 个 Unicode 码点作为参数,返回它们组成的字符串。
注意,该方法不支持 Unicode 码点大于 0xFFFF
的字符,即传入的参数不能大于 0xFFFF
。
String.fromCharCode(0x20BB7)
// "ஷ"
上面代码返回字符的编号是0x0BB7
,而不是0x20BB7
。它的根本原因在于,码点大于0xFFFF
的字符占用四个字节,而 JavaScript 只支持两个字节的字符。这种情况下,必须把0x20BB7
拆成两个字符表示。
String.fromCharCode(0xD842, 0xDFB7)
// "𠮷"
上面代码中,0x20BB7
拆成两个字符0xD842
和0xDFB7
(即两个两字节字符,合成一个四字节字符),就能得到正确的结果。码点大于0xFFFF
的字符的四字节表示法,由UTF-16编码方法决定。
ES6 String.fromCodePoint()
ES5 提供 String.fromCharCode
方法,用于从码点返回对应字符,但是这个方法不能识别 32 位的 UTF-16 字符(Unicode 编号大于 0xFFFF
)。
String.fromCharCode(0x20BB7)
// "ஷ"
上面代码中,String.fromCharCode
不能识别大于 0xFFFF
的码点,所以 0x20BB7
就发生了溢出,最高位 2
被舍弃了,最后返回码点 U+0BB7
对应的字符,而不是码点 U+20BB7
对应的字符。
ES6 提供了 String.fromCodePoint
方法,可以识别大于 0xFFFF
的字符,弥补了 String.fromCharCode
方法的不足。在作用上,正好与 codePointAt
方法相反。
String.fromCodePoint(0x20BB7)
// "𠮷"
String.fromCodePoint(0x78, 0x1f680, 0x79) === 'x\uD83D\uDE80y'
// true
上面代码中,如果 String.fromCodePoint
方法有多个参数,则它们会被合并成一个字符串返回。
注意,fromCodePoint
方法定义在 String
对象上,而 codePointAt
方法定义在字符串的实例对象上。
3.3 charAt()
- 作用:根据索引获取指定位置的字符
- 参数:索引
- 返回:字符
charAt
方法返回指定位置的字符,参数是从 0 开始编号的位置。
var s = new String('abc');
s.charAt(1) // "b"
s.charAt(s.length - 1) // "c"
用数组下标替代
'abc'.charAt(1) // "b"
'abc'[1] // "b"
区别:当索引超出范围时,str[]
获取的结果是 undefined
,运行机制是和对象一样,而 charAt
获取的是空字符串
var str = 'abc';
str.charAt(100) //=> ''
str[100] //=> undefined
如果参数为负数,或大于等于字符串的长度,charAt
返回空字符串。
'abc'.charAt(-1) // ""
'abc'.charAt(3) // ""
3.4 charCodeAt()
- 作用:获取给定位置字符对应的 Unicode 码点(ASCII 码值)
- 参数:索引
- 返回:字符对应的码值
相当于 String.fromCharCode()
的逆操作。
'abc'.charCodeAt(1) // 98
abc
的 1 号位置的字符是 b
,它的 Unicode 码点是 98
。
如果没有任何参数,charCodeAt
返回首字符的 Unicode 码点。
'abc'.charCodeAt() // 97
上面代码中,首字符 a
的 Unicode 编号是 97
。
注意,
charCodeAt
方法返回的 Unicode 码点不大于65536(0xFFFF)
,也就是说,只返回两个字节的字符的码点。如果遇到 Unicode 码点大于65536
的字符,必需连续使用两次charCodeAt
,不仅读入charCodeAt(i)
,还要读入charCodeAt(i+1)
,将两个 16 字节放在一起,才能得到准确的字符。
如果参数为负数,或大于等于字符串的长度,charCodeAt
返回 NaN
。
ES6 codePointAt()
JavaScript 内部,字符以 UTF-16 的格式储存,每个字符固定为 2 个字节。对于那些需要 4 个字节储存的字符(Unicode 码点大于 0xFFFF
的字符),JavaScript 会认为它们是两个字符。
var s = "𠮷";
s.length // 2
s.charAt(0) // ''
s.charAt(1) // ''
s.charCodeAt(0) // 55362
s.charCodeAt(1) // 57271
上面代码中,汉字“𠮷”(注意,这个字不是“吉祥”的“吉”)的码点是0x20BB7
,UTF-16 编码为 0xD842
0xDFB7
(十进制为55362
57271
),需要 4 个字节储存。对于这种 4 个字节的字符,JavaScript 不能正确处理,字符串长度会误判为 2,而且 charAt
方法无法读取整个字符,charCodeAt
方法只能分别返回前两个字节和后两个字节的值。
ES6 提供了 codePointAt
方法,能够正确处理 4 个字节储存的字符,返回一个字符的码点。
let s = '𠮷a';
s.codePointAt(0) // 134071
s.codePointAt(1) // 57271
s.codePointAt(2) // 97
codePointAt
方法的参数,是字符在字符串中的位置(从 0 开始)。上面代码中,JavaScript 将“𠮷a”视为三个字符,codePointAt
方法在第一个字符上,正确地识别了“𠮷”,返回了它的十进制码点 134071
(即十六进制的20BB7)。在第二个字符(即“𠮷”的后两个字节)和第三个字符“a”上,codePointAt
方法的结果与 charCodeAt
方法相同。
总之,codePointAt
方法会正确返回 32 位的 UTF-16 字符的码点。对于那些两个字节储存的常规字符,它的返回结果与 charCodeAt
方法相同。
codePointAt
方法返回的是码点的十进制值,如果想要十六进制的值,可以使用 toString
方法转换一下。
let s = '𠮷a';
s.codePointAt(0).toString(16) // "20bb7"
s.codePointAt(2).toString(16) // "61"
你可能注意到了,codePointAt
方法的参数,仍然是不正确的。比如,上面代码中,字符 a
在字符串 s
的正确位置序号应该是 1
,但是必须向 codePointAt
方法传入 2
。解决这个问题的一个办法是使用 for...of
循环,因为它会正确识别 32 位的 UTF-16 字符。
let s = '𠮷a';
for (let ch of s) {
console.log(ch.codePointAt(0).toString(16));
}
// 20bb7
// 61
codePointAt
方法是测试一个字符由两个字节还是由四个字节组成的最简单方法。
function is32Bit(c) {
return c.codePointAt(0) > 0xFFFF;
}
is32Bit("𠮷") // true
is32Bit("a") // false
ES6 at()
ES5 对字符串对象提供 charAt
方法,返回字符串给定位置的字符。该方法不能识别码点大于 0xFFFF
的字符。
'abc'.charAt(0) // "a"
'𠮷'.charAt(0) // "\uD842"
上面代码中,charAt
方法返回的是 UTF-16 编码的第一个字节,实际上是无法显示的。
目前,有一个提案,提出字符串实例的 at
方法,可
'abc'.at(0) // "a"
'𠮷'.at(0) // "𠮷"
ES6 normalize()
许多欧洲语言有语调符号和重音符号。为了表示它们,Unicode 提供了两种方法。一种是直接提供带重音符号的字符,比如Ǒ
(\u01D1
)。另一种是提供合成符号(combining character),即原字符与重音符号的合成,两个字符合成一个字符,比如O
(\u004F
)和ˇ
(\u030C
)合成Ǒ
(\u004F\u030C
)。
这两种表示方法,在视觉和语义上都等价,但是 JavaScript 不能识别。
'\u01D1'==='\u004F\u030C' //false
'\u01D1'.length // 1
'\u004F\u030C'.length // 2
上面代码表示,JavaScript 将合成字符视为两个字符,导致两种表示方法不相等。
ES6 提供字符串实例的 normalize()
方法,用来将字符的不同表示方法统一为同样的形式,这称为 Unicode 正规化。
'\u01D1'.normalize() === '\u004F\u030C'.normalize()
// true
normalize
方法可以接受一个参数来指定 normalize
的方式,参数的四个可选值如下。
NFC
,默认参数,表示“标准等价合成”(Normalization Form Canonical Composition),返回多个简单字符的合成字符。所谓“标准等价”指的是视觉和语义上的等价。NFD
,表示“标准等价分解”(Normalization Form Canonical Decomposition),即在标准等价的前提下,返回合成字符分解的多个简单字符。NFKC
,表示“兼容等价合成”(Normalization Form Compatibility Composition),返回合成字符。所谓“兼容等价”指的是语义上存在等价,但视觉上不等价,比如“囍”和“喜喜”。(这只是用来举例,normalize方法不能识别中文。)NFKD
,表示“兼容等价分解”(Normalization Form Compatibility Decomposition),即在兼容等价的前提下,返回合成字符分解的多个简单字符。
'\u004F\u030C'.normalize('NFC').length // 1
'\u004F\u030C'.normalize('NFD').length // 2
上面代码表示,NFC
参数返回字符的合成形式,NFD
参数返回字符的分解形式。
不过,normalize
方法目前不能识别三个或三个以上字符的合成。这种情况下,还是只能使用正则表达式,通过 Unicode 编号区间判断。
4. 字符的查找
4.1 indexOf、lastIndexOf 查找位置
- 作用:往后或往前查找一个字符串在调用此方法的字符串中第一次出现出现位置
- 参数:需要查找的字符串、开始查找的位置索引
- 返回:查找成功的字符串第一个位置的索引,不成功返回 -1
'hello world'.indexOf('o') //=> 4
'JavaScript'.indexOf('script') //=> -1
'hello world'.lastIndexOf('o') //=> 7 找到的是最后面的 o
- 对于
indexOf
方法,第二个参数表示从该位置开始向后查找 - 对于
lastIndexOf
,第二个参数表示从该位置起向前查找
'hello world'.indexOf('o', 6) //=> 7
'hello world'.lastIndexOf('o', 6) //=> 4
用于判断是否包含某个字符串
if (str.indexOf('a') > -1) {
//=> 包含 'a' 是执行
}
ES6 includes、startsWith、endsWith 判断
ES6 又提供了三种新方法。
includes()
:返回布尔值,表示是否找到了参数字符串。startsWith()
:返回布尔值,表示参数字符串是否在原字符串的头部。endsWith()
:返回布尔值,表示参数字符串是否在原字符串的尾部。
let s = 'Hello world!';
s.startsWith('Hello') //=> true
s.endsWith('!') //=> true
s.includes('o') //=> true
这三个方法都支持第二个参数,表示开始搜索的位置。
let s = 'Hello world!';
s.startsWith('world', 6) //=> true
s.endsWith('Hello', 5) //=> true
s.includes('Hello', 6) //=> false
上面代码表示,使用第二个参数n时,endsWith
的行为与其他两个方法有所不同。它针对前 n
个字符,而其他两个方法针对从第 n
个位置直到字符串结束。
4.2 search 查找
search
方法的用法等同于 match
,但是返回值为匹配的第一个位置。如果没有找到匹配,则返回 -1。
'cat, bat, sat, fat'.search('at') //=> 1
如果传入一个非正则表达式对象 **regexp**
,则会使用 **new RegExp(regexp)**
隐式地将其转换为正则表达式对象。
5. 字符串转换数组
5.1 split 分割
- 作用:和数组中的
join
相对应,按照给定规则分割字符串 - 参数:分割字符串或正则表达式、限定返回数组的最大成员数
- 返回:一个由分割出来的子字符串组成的数组
'a|b|c'.split('|') // ["a", "b", "c"]
如果分割规则为空字符串,则返回数组的成员是原字符串的每一个字符。
'a|b|c'.split('') // ["a", "|", "b", "|", "c"]
如果省略参数,则返回数组的唯一成员就是原字符串。
'a|b|c'.split() // ["a|b|c"]
如果满足分割规则的两个部分紧邻着(即中间没有其他字符),则返回数组之中会有一个空字符串。
'a||c'.split('|') // ['a', '', 'c']
如果满足分割规则的部分处于字符串的开头或结尾(即它的前面或后面没有其他字符),则返回数组的第一个或最后一个成员是一个空字符串。
'|b|c'.split('|') // ["", "b", "c"]
'a|b|'.split('|') // ["a", "b", ""]
split
方法还可以接受第二个参数,限定返回数组的最大成员数。
'a|b|c'.split('|', 0) // []
'a|b|c'.split('|', 1) // ["a"]
'a|b|c'.split('|', 2) // ["a", "b"]
'a|b|c'.split('|', 3) // ["a", "b", "c"]
'a|b|c'.split('|', 4) // ["a", "b", "c"]
split
方法还可以使用正则表达式作为参数
5.2 match 匹配
match
方法用于确定原字符串是否匹配某个子字符串,返回一个数组,成员为匹配的第一个字符串。如果没有找到匹配,则返回 null
。
'cat, bat, sat, fat'.match('at') // ["at"]
'cat, bat, sat, fat'.match('xt') // null
返回数组还有 index
属性和 input
属性,分别表示匹配字符串开始的位置和原始字符串。
var matches = 'cat, bat, sat, fat'.match('at');
matches.index // 1
matches.input // "cat, bat, sat, fat"
match
方法还可以使用正则表达式作为参数,行为在很大程度上有赖于 regexp 是否具有标志 g
。
如果 regexp 没有标志 g,就只能在 stringObject 中执行一次匹配。
- 如果没有找到任何匹配的文本, 返回
null
。 - 否则,它将返回一个数组,其中存放了与它找到的匹配文本有关的信息。
- 该数组的第 0 个元素存放的是匹配文本,而其余的元素存放的是与正则表达式的子表达式匹配的文本。
- 返回的数组还含有两个对象属性。
index
属性声明的是匹配文本的起始字符在 stringObject 中的位置,input
属性声明的是对 stringObject 的引用。
如果 regexp 具有标志 g,将执行全局检索,找到 stringObject 中的所有匹配子字符串。
- 若没有找到任何匹配的子串,返回
null
- 如果找到了一个或多个匹配子串,则返回一个数组。
- 全局匹配返回的数组的内容与前者大不相同,它的数组元素中存放的是 stringObject 中所有的匹配子串
- 没有
index
属性或input
属性。
注意:在全局检索模式下,
match()
不提供与子表达式匹配的文本的信息,也不声明每个匹配子串的位置。如果您需要这些全局检索的信息,可以使用RegExp.exec()
。
6. 字符的操作
6.1 concat 拼接
concat
方法用于连接两个字符串,返回一个新字符串,不改变原字符串。
var s1 = 'abc';
var s2 = 'def';
s1.concat(s2) //=> "abcdef"
s1 //=> "abc"
该方法可以接受多个参数。
'a'.concat('b', 'c') //=> "abc"
如果参数不是字符串,concat
方法会将其先转为字符串,然后再连接。
var one = 1;
var two = 2;
var three = '3';
''.concat(one, two, three) //=> "123"
one + two + three //=> "33"
上面代码中,concat
方法将参数先转成字符串再连接,所以返回的是一个三个字符的字符串。作为对比,加号运算符在两个运算数都是数值时,不会转换类型,所以返回的是一个两个字符的字符串。
6.2 slice 抽取
作用:用于从原字符串取出子字符串并以新字符串的方式返回,不改变原字符串
参数:开始位置、结束位置(不包含结束位置,可省略)
返回:抽取的子字符串
跟数组的slice
方法一样
它的第一个参数是子字符串的开始位置,第二个参数是子字符串的结束位置(不含该位置)。
'JavaScript'.slice(0, 4) // "Java"
如果省略第二个参数,则表示子字符串一直到原字符串结束。
'JavaScript'.slice(4) // "Script"
支持负数索引
- 参数中有负数,则是从后面开始算起
- 负数运算规则:数组总长度 + 负数索引
- 如果这时它大于数组长度(比如第二个参数为-4,但数组长度为3),则会重置为从 0 开始。
如果第一个参数大于第二个参数,slice方法返回一个空字符串。
'JavaScript'.slice(2, 1) // ""
6.3 substring 抽取
substring
方法的作用和语法与 slice
一样,但是不支持负数索引
它与slice作用相同,但有一些奇怪的规则,因此不建议使用这个方法,优先使用 slice。
如果第二个参数大于第一个参数,substring
方法会自动更换两个参数的位置。
'JavaScript'.substring(10, 4) // "Script"
// 等同于
'JavaScript'.substring(4, 10) // "Script"
上面代码中,调换 substring
方法的两个参数,都得到同样的结果。
如果参数是负数,substring
方法会自动将负数转为 0。
'Javascript'.substring(-3) // "JavaScript"
'JavaScript'.substring(4, -3) // "Java"
参数 -3 会自动变成 0,等同于 'JavaScript'.substring(4, 0)
。由于第二个参数小于第一个参数,会自动互换位置,所以返回 'Java'
。
6.4 substr 抽取
- 作用:与
substring
一样 - 参数:开始位置、抽取长度(默认为从开始到结尾)
- 返回:与
substring
一样
如果第一个参数是负数,表示倒数计算的字符位置。如果第二个参数是负数,将被自动转为 0,因此会返回空字符串。
'JavaScript'.substr(-6) // "Script"
'JavaScript'.substr(4, -1) // ""
由于参数 -1 自动转为 0,表示子字符串长度为 0,所以返回空字符串。
6.5 trim 去除空格
trim
方法用于去除字符串两端的空格,返回一个新字符串,不改变原字符串。
' hello world '.trim()
// "hello world"
该方法去除的不仅是空格,还包括制表符(\t、\v)、换行符(\n)和回车符(\r)。
'\r\nabc \t'.trim() // 'abc'
6.6 toLowerCase、toUpperCase大小写
- 作用:大小写转换
- 参数:无
- 返回:转换后的字符串
toLowerCase
方法用于将一个字符串全部转为小写,toUpperCase
则是全部转为大写
'Hello World'.toLowerCase()
// "hello world"
'Hello World'.toUpperCase()
// "HELLO WORLD"
这个方法也可以将布尔值或数组转为大写字符串,但是需要通过 call
方法使用。
String.prototype.toUpperCase.call(true)
// 'TRUE'
String.prototype.toUpperCase.call(['a', 'b', 'c'])
// 'A,B,C'
6.7 localeCompare 比较
localeCompare
方法用于比较两个字符串。它返回一个整数,如果小于 0,表示第一个字符串小于第二个字符串;如果等于 0,表示两者相等;如果大于 0,表示第一个字符串大于第二个字符串。
'apple'.localeCompare('banana')// -1
'apple'.localeCompare('apple')// 0
该方法的最大特点,就是会考虑自然语言的顺序。举例来说,正常情况下,大写的英文字母小于小写字母。
'B' > 'a' // false
上面代码中,字母 B 小于字母 a。这是因为 JavaScript 采用的是 Unicode 码点比较,B 的码点是 66,而 a 的码点是 97。
但是,localeCompare
方法会考虑自然语言的排序情况,将 B 排在 a 的前面。
'B'.localeCompare('a') //=> 1
上面代码中,localeCompare
方法返回整数 1(也有可能返回其他正整数),表示 B 较大。
6.8 replace 替换
- 作用:替换匹配的子字符串,一般情况下只替换第一个匹配(除非使用带有 g 修饰符的正则表达式)
- 参数:需要匹配的子字符串或正则表达式、替换的字符串
- 返回:替换后的字符串
'aaa'.replace('a', 'b') //=> "baa"
第一个参数是正则时:
- 如果 regexp 具有全局标志
g
,那么将替换所有匹配的子串。 - 否则,它只替换第一个匹配子串。
第二个参数可以是字符串,也可以是函数:
- 如果它是字符串,那么每个匹配都将由字符串替换。但是 replacement 中的
$
字符具有特定的含义。如下表所示,它说明从模式匹配得到的字符串将用于替换。
|字符|替换文本|
|:—-😐:—-😐
|$1、$2、…、$99| 与 regexp 中的第 1 到第 99 个子表达式相匹配的文本。|
|$& |与 regexp 相匹配的子串。|
|$` |位于匹配子串左侧的文本。|
|$’|位于匹配子串右侧的文本。|
|$$ |直接量符号。| - 如果是函数,每个匹配都调用该函数,它返回的字符串将作为替换文本使用。
- 该函数的第一个参数是匹配模式的字符串
- 接下来的参数是与模式中的子表达式匹配的字符串,可以有 0 个或多个这样的参数
- 接下来的参数是一个整数,声明了匹配在 stringObject 中出现的位置
- 最后一个参数是 stringObject 本身
ES6 repeat 重复
repeat(n)
方法返回一个新字符串,表示将原字符串重复 n
次。
'x'.repeat(3) // "xxx"
'hello'.repeat(2) // "hellohello"
'na'.repeat(0) // ""
参数如果是小数,会被取整。
'na'.repeat(2.9) // "nana"
如果 repeat
的参数是负数或者 Infinity
,会报错。
'na'.repeat(Infinity)
// RangeError
'na'.repeat(-1)
// RangeError
但是,如果参数是 0
到 -1
之间的小数,则等同于 0
,这是因为会先进行取整运算。0
到 -1
之间的小数,取整以后等于-0,repeat
视同为 0
。
'na'.repeat(-0.9) // ""
参数 NaN
等同于 0
。
'na'.repeat(NaN) // ""
如果repeat
的参数是字符串,则会先转换成数字。
'na'.repeat('na') // ""
'na'.repeat('3') // "nanana"
ES6 padStart、padEnd 补全
ES2017 引入了字符串补全长度的功能。如果某个字符串不够指定长度,会在头部或尾部补全。padStart()
用于头部补全,padEnd()
用于尾部补全。
'x'.padStart(5, 'ab') // 'ababx'
'x'.padStart(4, 'ab') // 'abax'
'x'.padEnd(5, 'ab') // 'xabab'
'x'.padEnd(4, 'ab') // 'xaba'
上面代码中,padStart
和 padEnd
一共接受两个参数,第一个参数用来指定字符串的最小长度,第二个参数是用来补全的字符串。
如果原字符串的长度,等于或大于指定的最小长度,则返回原字符串。
'xxx'.padStart(2, 'ab') // 'xxx'
'xxx'.padEnd(2, 'ab') // 'xxx'
如果用来补全的字符串与原字符串,两者的长度之和超过了指定的最小长度,则会截去超出位数的补全字符串。
'abc'.padStart(10, '0123456789')
// '0123456abc'
如果省略第二个参数,默认使用空格补全长度。
'x'.padStart(4) // ' x'
'x'.padEnd(4) // 'x '
padStart
的常见用途是为数值补全指定位数。下面代码生成 10 位的数值字符串。
'1'.padStart(10, '0') // "0000000001"
'12'.padStart(10, '0') // "0000000012"
'123456'.padStart(10, '0') // "0000123456"
另一个用途是提示字符串格式。
'12'.padStart(10, 'YYYY-MM-DD') // "YYYY-MM-12"
'09-12'.padStart(10, 'YYYY-MM-DD') // "YYYY-09-12"