É possível obter a probabilidade exata de uma subsequência específica usando uma representação em cadeia de Markov do problema. As especificidades de como construir a cadeia dependem da subsequência de interesse específica, mas darei alguns exemplos de como fazer isso.
Probabilidade exata via cadeia de Markov: considere uma sequência discreta de resultados de A,T,C,G que os resultados na sequência sejam permutáveis e suponha que estamos interessados em alguma substring de comprimento k . Para qualquer dado valor de n , deixar W ser o caso em que a subsequência de interesse ocorre, e deixá- Ha ser o caso em que os últimos a resultados são o primeiro a<k caracteres na subsequência de interesse (mas não mais do que isto) . Usamos esses eventos para fornecer a seguinte partição de k+1 possíveis estados de interesse:
State 0State 1State 2State 3⋮State k−1State kW¯∩H0, W¯∩H1, W¯∩H2, W¯∩H3, ⋮W¯∩Hk−1,W.
θA+θT+θC+θG=1State 0n=0(k+1)×(k+1)matriz que representa as probabilidades de transição usando os estados acima. Se a substring de interesse não tiver sido alcançada, cada transição poderá aproximá-lo um pouco da substring ou retornar a um estado anterior que depende da substring específica. Uma vez atingida a substring, esse é um estado absorvente da cadeia, representando o fato de que o evento de interesse ocorreu.
AAAAAA
P=⎡⎣⎢⎢⎢⎢⎢⎢⎢⎢⎢⎢⎢⎢⎢⎢⎢⎢⎢⎢1−θA1−θA1−θA1−θA1−θA1−θA0θA0000000θA0000000θA0000000θA0000000θA0000000θA1.⎤⎦⎥⎥⎥⎥⎥⎥⎥⎥⎥⎥⎥⎥⎥⎥⎥⎥⎥⎥
ACTAGC
P=⎡⎣⎢⎢⎢⎢⎢⎢⎢⎢⎢⎢⎢⎢⎢⎢⎢⎢⎢⎢1−θA1−θA−θC1−θA−θT1−θA1−θA−θC−θG1−θA−θC0θAθAθA0θAθA00θC00θC0000θT0000000θA0000000θG000000θC1.⎤⎦⎥⎥⎥⎥⎥⎥⎥⎥⎥⎥⎥⎥⎥⎥⎥⎥⎥⎥
nP(W|n)={Pn}0,kn<k
R
n
#Create function to give n-step transition matrix for n = 1...N
#We will use the example of the substring of interest "AAAAAA"
#a is the probability of A
#t is the probability of T
#c is the probability of C
#g is the probability of G
#N is the last value of n
PROB <- function(N,a,t,c,g) { TOT <- a+t+c+g;
a <- a/TOT;
t <- t/TOT;
c <- c/TOT;
g <- g/TOT;
P <- matrix(c(1-a, a, 0, 0, 0, 0, 0,
1-a, 0, a, 0, 0, 0, 0,
1-a, 0, 0, a, 0, 0, 0,
1-a, 0, 0, 0, a, 0, 0,
1-a, 0, 0, 0, 0, a, 0,
1-a, 0, 0, 0, 0, 0, a,
0, 0, 0, 0, 0, 0, 1),
nrow = 7, ncol = 7,
byrow = TRUE);
PPP <- array(0, dim = c(7,7,N));
PPP[,,1] <- P;
for (n in 2:N) { PPP[,,n] <- PPP[,,n-1] %*% P; }
PPP }
#Calculate probability for N = 100 for equiprobable outcomes
N <- 100;
a <- 1/4;
t <- 1/4;
c <- 1/4;
g <- 1/4;
PROB(N,a,t,c,g)[1,7,N];
[1] 0.01732435
AAAAAAn=1000.01732435