linux - 来自 shell 的 GROUP BY/SUM

Question

我有一个包含如下数据的大文件：

a 23
b 8
a 22
b 1

我希望能够得到这个：

a 45
b 9

我可以先对这个文件进行排序，然后在 Python 中扫描文件一次。什么是这样做的好直接命令行方式？

score 40 · Accepted Answer

编辑：现代（GNU/Linux）解决方案，如多年前评论中所述；-)。

awk '{
    arr[$1]+=$2
   }
   END {
     for (key in arr) printf("%s\t%s\n", key, arr[key])
   }' file \
   | sort -k1,1

最初发布的解决方案，基于旧的 Unixsort选项：

awk '{
    arr[$1]+=$2
   }
   END {
     for (key in arr) printf("%s\t%s\n", key, arr[key])
   }' file \
   | sort +0n -1

我希望这有帮助。

score 8 · Accepted Answer

这里不需要 awk，甚至不需要排序——如果你有 Bash 4.0，你可以使用关联数组：

#!/bin/bash
declare -A values
while read key value; do
  values["$key"]=$(( $value + ${values[$key]:-0} ))
done
for key in "${!values[@]}"; do
  printf "%s %s\n" "$key" "${values[$key]}"
done

...或者，如果您首先对文件进行排序（这将更节省内存；GNU sort 能够对大于内存的文件进行排序，这是一个天真的脚本——无论是在 awk、python 还是 shell 中——通常不会），您可以以适用于旧版本的方式执行此操作（我希望以下内容适用于 bash 2.0）：

#!/bin/bash
read cur_key cur_value
while read key value; do
  if [[ $key = "$cur_key" ]] ; then
    cur_value=$(( cur_value + value ))
  else
    printf "%s %s\n" "$cur_key" "$cur_value"
    cur_key="$key"
    cur_value="$value"
  fi
done
printf "%s %s\n" "$cur_key" "$cur_value"

score 8 · Accepted Answer

这个 Perl 单线似乎可以完成这项工作：

perl -nle '($k, $v) = split; $s{$k} += $v; END {$, = " "; foreach $k (sort keys %s) {print $k, $s{$k}}}' inputfile

score 3 · Accepted Answer

这可以通过以下单线轻松实现：

cat /path/to/file | termsql "SELECT col0, SUM(col1) FROM tbl GROUP BY col0"

或者。

termsql -i /path/to/file "SELECT col0, SUM(col1) FROM tbl GROUP BY col0"

这里使用了 Python 包termsql，它是 SQLite 的包装器。请注意，目前它没有上传到PyPI，也只能在系统范围内安装（setup.py有点坏），比如：

pip install --user https://github.com/tobimensch/termsql/archive/master.zip

更新

2020 年 1.0 版本终于上传到PyPI，所以pip install --user termsql可以使用了。

score 2 · Accepted Answer

一种使用方式perl：

perl -ane '
    next unless @F == 2; 
    $h{ $F[0] } += $F[1]; 
    END { 
        printf qq[%s %d\n], $_, $h{ $_ } for sort keys %h;
    }
' infile

内容infile：

a 23
b 8
a 22
b 1

输出：

a 45
b 9

score 2 · Accepted Answer

使用GNU awk（版本小于 4）：

WHINY_USERS= awk 'END {
  for (E in a)
    print E, a[E]
    }
{ a[$1] += $2 }' infile

使用GNU awk >= 4：

awk 'END {
  PROCINFO["sorted_in"] = "@ind_str_asc"
  for (E in a)
    print E, a[E]
    }
{ a[$1] += $2 }' infile

score 1 · Accepted Answer

使用sort+awk组合可以尝试跟随，而不创建数组。

sort -k1 Input_file | 
awk '
  prev!=$1 && prev{
    print prev,(prevSum?prevSum:"N/A")
    prev=prevSum=""
  }
  {
    prev=$1
    prevSum+=$2
  }
  END{
    if(prev){
       print prev,(prevSum?prevSum:"N/A")
    }
}'

说明：为上述添加详细说明。

sort -k1 file1 |                          ##Using sort command to sort Input_file by 1st field and sending output to awk as an input.
awk '                                     ##Starting awk program from here.
  prev!=$1 && prev{                       ##Checking condition prev is NOT equal to first field and prev is NOT NULL.
    print prev,(prevSum?prevSum:"N/A")    ##Printing prev and prevSum(if its NULL then print N/A).
    prev=prevSum=""                       ##Nullify prev and prevSum here.
  }
  {
    prev=$1                               ##Assigning 1st field to prev here.
    prevSum+=$2                           ##Adding 2nd field to prevSum.
  }
  END{                                    ##Starting END block of this awk program from here.
    if(prev){                             ##Checking condition if prev is NOT NULL then do following.
       print prev,(prevSum?prevSum:"N/A") ##Printing prev and prevSum(if its NULL then print N/A).
    }
}'

linux - 来自 shell 的 GROUP BY/SUM

7 回答 7

更新

Related

Reference