如何将一个大的文本文件分割成具有相等行数的小文件?

我有一个大的(按行数)纯文本文件，我想把它分成更小的文件，也按行数。因此，如果我的文件有大约2M行，我想把它分成10个包含200k行的文件，或100个包含20k行的文件(加上一个文件;是否能被均匀整除并不重要)。

我可以在Python中相当容易地做到这一点，但我想知道是否有任何一种忍者方法来使用Bash和Unix实用程序(而不是手动循环和计数/分区行)。

当前回答

使用split命令:

split -l 200000 mybigfile.txt

2010-01-06 22:45:05

其他回答

将“file.txt”文件拆分为10,000行文件:

split -l 10000 file.txt

2018-02-27 09:11:14

你也可以使用AWK:

awk -vc=1 'NR%200000==0{++c}{print $0 > c".txt"}' largefile

2010-01-07 01:03:23

Use:

sed -n '1,100p' filename > output.txt

这里，1和100是您将在output.txt中捕获的行号。

2016-04-21 09:27:07

使用分割:

将文件分割为固定大小的片段，创建包含连续INPUT部分的输出文件(如果没有给定或INPUT为' -'则为标准输入)

语法split [options] [INPUT [PREFIX]]

2010-01-06 22:44:55

HDFS getmerge小文件并分割成合适的大小。

这个方法会导致换行:

split -b 125m compact.file -d -a 3 compact_prefix

我尝试为每个文件getmerge和分割成大约128 MB。

# Split into 128 MB, and judge sizeunit is M or G. Please test before use.

begainsize=`hdfs dfs -du -s -h /externaldata/$table_name/$date/ | awk '{ print $1}' `
sizeunit=`hdfs dfs -du -s -h /externaldata/$table_name/$date/ | awk '{ print $2}' `
if [ $sizeunit = "G" ];then
    res=$(printf "%.f" `echo "scale=5;$begainsize*8 "|bc`)
else
    res=$(printf "%.f" `echo "scale=5;$begainsize/128 "|bc`)  # Celling ref http://blog.csdn.net/naiveloafer/article/details/8783518
fi
echo $res
# Split into $res files with a number suffix. Ref:  http://blog.csdn.net/microzone/article/details/52839598
compact_file_name=$compact_file"_"
echo "compact_file_name: "$compact_file_name
split -n l/$res $basedir/$compact_file -d -a 3 $basedir/${compact_file_name}

2017-11-08 07:43:09

如何将一个大的文本文件分割成具有相等行数的小文件?

推荐文章

最新文章

标签