如何通过Linux上的脚本找到文件的编码?

我需要找到放在一个目录中的所有文件的编码。有没有办法找到所使用的编码?

file命令不能做到这一点。

我感兴趣的编码是ISO 8859-1。如果是其他编码，我想将文件移动到另一个目录。

当前回答

如果谈论的是XML文件(ISO-8859-1)，其中的XML声明指定了编码:<??> . xml version="1.0" encoding="ISO-8859-1" 因此，您可以使用正则表达式(例如，使用Perl)来检查每个文件是否有这样的规范。

更多信息可以在这里找到:如何确定文本文件编码。

2012-01-27 14:31:38

其他回答

听起来你在找恩卡。它可以猜测甚至在编码之间进行转换。看看手册页就知道了。

否则，使用file -i (Linux)或file -i (OS X)。这将输出文件的mime类型信息，其中还将包括字符集编码。我也找到了它的手册页:)

2009-04-30 05:41:58

将ISO 8859-1编码转换为ASCII:

iconv -f ISO_8859-1 -t ASCII filename.txt

2019-02-18 12:29:54

下面是一个在Mac OS X上使用file -I和iconv的示例脚本。

对于你的问题，你需要使用mv而不是iconv:

#!/bin/bash
# 2016-02-08
# check encoding and convert files
for f in *.java
do
  encoding=`file -I $f | cut -f 2 -d";" | cut -f 2 -d=`
  case $encoding in
    iso-8859-1)
    iconv -f iso8859-1 -t utf-8 $f > $f.utf8
    mv $f.utf8 $f
    ;;
  esac
done

2016-02-08 16:53:37

在PHP中，你可以像这样检查它:

显式指定编码列表:

php -r "echo 'probably : ' . mb_detect_encoding(file_get_contents('myfile.txt'), 'UTF-8, ASCII, JIS, EUC-JP, SJIS, iso-8859-1') . PHP_EOL;"

更准确的"mb_list_encodings":

php -r "echo 'probably : ' . mb_detect_encoding(file_get_contents('myfile.txt'), mb_list_encodings()) . PHP_EOL;"

在第一个示例中，您可以看到我使用了一个可能匹配的编码列表(检测列表顺序)。为了得到更准确的结果，你可以使用所有可能的编码:mb_list_encodings()

注意mb_*函数需要php-mbstring:

apt-get install php-mbstring

2019-07-12 16:08:51

file -bi <file name>

如果你喜欢对一堆文件这样做

for f in `find | egrep -v Eliminate`; do echo "$f" ' -- ' `file -bi "$f"` ; done

2012-07-27 05:39:06

如何通过Linux上的脚本找到文件的编码?

推荐文章

最新文章

标签