这是我的数据框的样子:
库(数据表)
df <- fread('
Name EventType Date SalesAmount RunningTotal Runningtotal(prior365Days)
John Email 1/1/2014 0 0 0
John Sale 2/1/2014 10 10 10
John Sale 7/1/2014 20 30 30
John Sale 4/1/2015 30 60 50
John Webinar 5/1/2015 0 60 50
Tom Email 1/1/2014 0 0 0
Tom Sale 2/1/2014 15 15 15
Tom Sale 7/1/2014 10 25 25
Tom Sale 4/1/2015 25 50 35
Tom Webinar 5/1/2015 0 50 35
')
df[,Date:= as.Date(Date, format="%m/%d/%Y")]
最后一列是我想要的列,它是过去 365 天滚动窗口中 SalesAmount(每个名称)的累积总和,我在 @6pool 的帮助下执行了此操作。他的解决方案是:
df$EventDate <- as.Date(df$EventDate, format="%d/%m/%Y")
df <- df %>%
group_by (Name) %>%
arrange(EventDate) %>%
mutate(day = EventDate - EventDate[1])
f <- Vectorize(function(i)
sum(df[df$Name[i] == df$Name & df$day[i] - df$day >= 0 &
df$day[i] - df$day <= 365, "SalesAmount"]), vec="i")
df$RunningTotal365 <- f(1:nrow(df))
但是,df$RunningTotal365 <- f(1:nrow(df)) 需要很长时间(到目前为止超过 1.5 天),因为我的数据框超过 150 万行。在我最初的问题中,有人建议我“rollapply”,但我一直在努力弄清楚如何在这种情况下使用它。请帮忙。