perl 关于Url Encode 和 Url Decode

yanfei · 发表于 2015-12-27 07:35:20

对于url中的中文字符，大多数网站都会做编码的处理，这里我们来探讨常用的2中编码和解码在perl中实现。
　　常用的编码方式有2种，GBK和UTF-8，因此URL编码也使用GBK的URL编码和UTF-8的URL编码。
　　1：GBK进行URL Encode。
1）先对字符串进行GBK编码。请注意，汉字本身采用的就是GBK编码，因此对于汉字，不应该再使用GBK编码。所以实际上如果是针对URL有汉字的URL进行URL编码，就直接使用URL编码函数即可。
2）然后进行URL编码
while(<>){
      chomp;
      my $gbkec = Encode::encode("gbk",$_); #对字符串进行GBK编码，如果是汉字要省略掉这一步，否则为重复编码。
      my $gbkuec = URI::Escape::uri_escape($gbkec); #对已经进行GBK编码的字符串进行URL编码
      my $encode = URI::Escape::uri_escape($_); #如果是汉字，可以直接进行URL编码
      print "$_ ->[GBK]$gbkec ->[URLencode]$gbkuec\n";
      print "$_ -> [URLencode]$encode\n";
}
测试输出：
@# ->[GBK]@# ->[URLencode]%40%23
@# -> [URLencode]%40%23
然后进行URL的GBK解码
解码的过程也要注意，汉字是不是重复使用了GBK解密，代码如下
while(<>){
      chomp;
      my $gbkec = URI::Escape::uri_unescape($_); #对URL进行解码
      my $chstr = Encode::decode("gbk",$gbkec); #对已经解码的url进行GBK解码，汉字本身为GBK编码，不用在进行GBK解码。
　　my $decode = URI::Escape::uri_unescape($_); #汉字编码的url可直接进行这一步
      print "$_ ->[URLdecode]$gbkec ->[GBKDecode]$chstr\n";
      print "$_ -> [URLdecode]$decode\n";
}
　　测试输出：
%40%23
%40%23 ->[URLdecode]@# ->[GBKDecode]@#
%40%23 -> [URLdecode]@#
2：UTF-8进行URL编码。
　　因为汉字采用的是GBK编码，因此不论在URL编码前还是在URL解码后，都需要调用相应函数进行操作。
对于UTF-8的编码和解码，我们使用UTF-8模块中的函数。
如下是编码后又解码的过程：
　　while(<>){
      chomp;
　　my $utf8str = $_;
      utf8::encode($utf8str); #进行UTF-8编码，函数直接操作变量
      my $encode = URI::Escape::uri_escape($utf8str); #对已经经过UTF-8编码的对象进行URL编码
      print "UTF-8 Encode:[$_] -> [$utf8str] -> [$encode]\n";
　　my $urldecode = URI::Escape::uri_unescape($encode); #对经过UTF-8编码的URL进行URL解码
      my $decode = $urldecode;
      utf8::decode($decode); #对经过URL解码后的字符串进行UTF-8解码
      print "UTF-8 Decode:[$encode] -> [$urldecode] -> [$decode]\n";
}
　　测试输出：
测试
UTF-8 Encode:[测试] -> [Â²Ã￠Ã&Scaron;Ã”] -> [%C2%B2%C3%A2%C3%8A%C3%94]
UTF-8 Decode:[%C2%B2%C3%A2%C3%8A%C3%94] -> [Â²Ã￠Ã&Scaron;Ã”] -> [测试]

　　
　　总结：大多数国内网站对中文编码都采用GBK，因为这样会少一步编码处理。比如百度，即采用GBK编码。
　　但是国外网站大多采用UTF-8编码，因为UTF-8相对GBK更广泛。

账号		自动登录	找回密码
密码			立即注册

大疆运维招人啦，

C++ :try 语句块和异常处理

C++的多态

Red Hat RHCE 8 (EX294) Cert Guide

Java/C++ 区别：看完这一篇，就够用！

别再用过时库了！这 13 个顶级 C++ 库才是

c++ size_t 和 int 的区别

[经验分享] perl 关于Url Encode 和 Url Decode

浏览过的版块

扫码加入运维网微信交流群