我有一个长格式的巨大数据文件——下面提供了其中的一部分。每个 ID 可以有几行,其中 status 是最终状态。但是我需要使用时变协变量进行分析,因此需要创建两个新的时间变量并更新状态变量。我已经为此苦苦挣扎了一段时间,我无法弄清楚如何有效地做到这一点,因为每个 ID 最多可以有四行。时变变量为NUM.AFTER.DIAG
。如果NUM.AFTER.DIAG==0
那么它很容易,在哪里time1=0
和time2=STATUSDATE
。但是,NUM.AFTER.DIAG==1
那时我需要在哪里创建一个新行time1=0
,time2=DOB-DATE.DIAG
并且NUM.AFTER.DIAG=0
还要确保STATUS="B"
。然后第二行将time1=time2
来自前一行,并且time2=STATUSDATE-DATE.DIAG-time1
从这一行开始。同样,如果有更多行,则需要相互减去不同的行。此外,如果 NUM.AFTER.DIAG==0 但有多行,则可以删除所有额外的行。
有什么想法可以有效解决这个问题吗?我看过 john Fox 展开命令,但它假定所有间隔都是宽格式开始的。
编辑:请求的表。至于审查变量:“D”=事件(死亡)
structure(list(ID = c(187L, 258L, 265L, 278L, 281L, 281L, 283L,
283L, 284L, 291L, 292L, 292L, 297L, 299L, 305L, 305L, 311L, 311L,
319L, 319L, 319L, 322L, 322L, 329L, 329L, 333L, 333L, 333L, 334L,
334L), STATUS = c("D", "B", "B", "B", "B", "B", "D", "D", "B",
"B", "B", "B", "D", "D", "D", "D", "B", "B", "B", "B", "B", "D",
"D", "B", "B", "D", "D", "D", "D", "D"), STATUSDATE = structure(c(11153,
15034, 15034, 15034, 15034, 15034, 5005, 5005, 15034, 15034,
15034, 15034, 6374, 5005, 7562, 7562, 15034, 15034, 15034, 15034,
15034, 7743, 7743, 15034, 15034, 4670, 4670, 4670, 5218, 5218
), class = "Date"), DATE.DIAG = structure(c(4578, 4609, 4578,
4487, 4670, 4670, 4517, 4517, 4640, 4213, 4397, 4397, 4397, 4487,
4213, 4213, 4731, 4731, 4701, 4701, 4701, 4397, 4397, 4578, 4578,
4275, 4275, 4275, 4456, 4456), class = "Date"), DOB = structure(c(NA,
13010, NA, NA, -1082, -626, 73, 1353, 13679, NA, 1626, 3087,
-626, -200, 2814, 3757, 1930, 3787, 6740, 13528, 14167, 5462,
6557, 7865, 9235, -901, -504, -108, -535, -78), class = "Date"),
NUM.AFTER.DIAG = c(0, 1, 0, 0, 0, 0, 0, 0, 1, 0, 0, 0, 0,
0, 0, 0, 0, 0, 1, 2, 3, 1, 2, 1, 2, 0, 0, 0, 0, 0)), .Names = c("ID",
"STATUS", "STATUSDATE", "DATE.DIAG", "DOB", "NUM.AFTER.DIAG"), row.names = c(NA,
30L), class = "data.frame")
编辑:我确实想出了一个解决方案,虽然可能不是很有效。
u1<-ddply(p,.(ID),function(x) {
if (x$NUM.AFTER.DIAG==0){
x$time1<-0
x$time2<-x$STATUSDATE-x$DATE.DIAG
x<-x[1,]
}
else {
x<-rbind(x,x[1,])
x<-x[order(x$DOB),]
u<-max(x$NUM.AFTER.DIAG)
x$NUM.AFTER.DIAG<-0:u
x$time1[1]<-0
x$time2[1:(u)]<-x$DOB[2:(u+1)]-x$DATE.DIAG[2:(u+1)]
x$time2[u+1]<-x$STATUSDATE[u]-x$DATE.DIAG[u]
x$time1[2:(u+1)]<-x$time2[1:u]
x$STATUS[1:u]<-"B"
}
x
}
)