0

我有一列是每个家庭的收入,我想使用一个指标以便在我的分析中使用它。如果收入大于 35000 美元,我希望它为 1,否则为 0。

  Household          INCOM
      1         (5) $50,000 - $74,999
      2         (3) $25,000 - $34,99
      3         (4) $35,000 - $49,999

所以指标变量必须是

     IND
      1
      0
      1

我使用了以下内容,但当然它不起作用,因为 INCOM 不是数字:

     df %>% mutate(`income` = 1* (INCOM >= 35000), )       
4

2 回答 2

1

一种基础 R 方法可能是

df$Ind <- as.integer(sapply(strsplit(sub(".*\\$(\\d+).*\\$(\\d+).*", "\\1-\\2", 
           gsub(",", "", df$INCOM)), "-"), function(x) any(as.numeric(x) > 35000)))

df
#  Household                 INCOM Ind
#1         1 (5) $50,000 - $74,999   1
#2         2  (3) $25,000 - $34,99   0
#3         3 (4) $35,000 - $49,999   1

我试图在一行中完成所有操作,让我一一解释所有命令

使用gsub我们删除所有逗号INCOM

gsub(",", "", df$INCOM)
#[1] "(5) $50000 - $74999" "(3) $25000 - $3499"  "(4) $35000 - $49999"

然后用于sub提取后面的两个数字$

sub(".*\\$(\\d+).*\\$(\\d+).*", "\\1-\\2", gsub(",", "", df$INCOM))
#[1] "50000-74999" "25000-3499"  "35000-49999"

然后我们将字符串拆分为-

strsplit(sub(".*\\$(\\d+).*\\$(\\d+).*", "\\1-\\2", gsub(",", "", df$INCOM)), "-")

#[[1]]
#[1] "50000" "74999"

#[[2]]
#[1] "25000" "3499" 

#[[3]]
#[1] "35000" "49999"

然后使用sapply将这些数字转换为数字并检查是否有任何数字大于 35000 并相应地给出 1/0 值。

于 2019-07-05T02:02:52.403 回答
0

我们可以使用gsubfn来获取二进制格式。我们从 'INCOM' 中删除$,with ,捕获 中的数字,将其转换为,与 35000 进行比较并提取二进制数gsubgsubfnnumeric

library(gsubfn)
df1$ind <- as.integer(sub(".* ", "", gsubfn("(\\d+) - (\\d+)",
    ~ +(any(as.numeric(c(x, y))  > 35000)), gsub("[$,]", "", df1$INCOM))))
 df1$ind
#[1] 1 0 1

或者一个选项tidyverse

library(tidyverse)
library(readr)
df1 %>% 
  extract(INCOM, into = c("col1", "col2"), remove = FALSE, 
    ".*\\$(\\d+,\\d+) - \\$(\\d+,\\d+)") %>% 
  mutate_at(vars(starts_with('col')), parse_number) %>%
  mutate(Ind = as.integer(col1 > 35000 | col2 > 35000)) %>% 
  select(-col1, -col2)
#   Household                 INCOM Ind
#1         1 (5) $50,000 - $74,999   1
#2         2  (3) $25,000 - $34,99   0
#3         3 (4) $35,000 - $49,999   1

或者另一种选择是

str_remove_all(df1$INCOM, ",") %>%
      str_extract_all("(?<=[$])([0-9]+)") %>%
      map_int(~ +(any(as.numeric(.x) > 35000)))
#[1] 1 0 1

数据

df1 <- structure(list(Household = 1:3, INCOM = c("(5) $50,000 - $74,999", 
"(3) $25,000 - $34,99", "(4) $35,000 - $49,999")), class = "data.frame",
row.names = c(NA, 
-3L))
于 2019-07-05T02:39:55.603 回答