Estatísticas e Big Data

Perguntas e respostas para pessoas interessadas em estatística, aprendizado de máquina, análise de dados, mineração de dados e visualização de dados

2
Processo Gaussiano e Correlação
Fiquei me perguntando por que as pessoas usam processos gaussianos (GP) para modelar uma função desconhecida (às vezes determinística). Por exemplo, considere uma função desconhecida . Temos três observações independentes dessa função: y=f(x)y=f(x)y=f(x)(x1,y1);(x2,y2);(x3,y3)(x1,y1);(x2,y2);(x3,y3)\big(x_1,y_1); \big(x_2,y_2); \big(x_3,y_3) Para aprender a função subjacente, o GP é uma técnica não paramétrica comum que trata …

1
Diferença entre deslocamento e exposição em Regressão de Poisson
Exposição e deslocamento são duas técnicas frequentemente usadas em regressões de Poisson por atuários para prever a frequência da reivindicação. Pelo meu entendimento, deslocamento e exposição são as mesmas coisas, então não entendo por que existem dois termos para descrever a mesma coisa. É correto ou existem casos especiais (exceto …





1
remende treinamento inteligente e treinamento totalmente convolucional em rede neural totalmente convolucional
No artigo da rede neural totalmente convolucional , os autores mencionam tanto o treinamento inteligente quanto o treinamento totalmente convolucional. Meu entendimento para a construção do conjunto de treinamento é o seguinte: Dada uma M*Mimagem, extraia as sub-imagens com N*N, where ( N<M). As sub-imagens selecionadas são sobrepostas com outras. …

2
Derivada do Softmax em relação aos pesos
Eu sou novo no aprendizado profundo e estou tentando calcular a derivada da seguinte função em relação à matriz :ww\mathbf w p(a)=ew⊤axΣdew⊤dxp(a)=ewa⊤xΣdewd⊤xp(a) = \frac{e^{w_a^\top x}}{\Sigma_{d} e^{w_d^\top x}} Usando a regra do quociente, recebo: ∂p(a)∂w=xew⊤axΣdew⊤dx−ew⊤axΣdxew⊤dx[Σdew⊤dx]2=0∂p(a)∂w=xewa⊤xΣdewd⊤x−ewa⊤xΣdxewd⊤x[Σdewd⊤x]2=0\frac{\partial p(a)}{\partial w} = \frac{xe^{w_a^\top x}\Sigma_{d} e^{w_d^\top x} - e^{w_a^\top x}\Sigma_{d} xe^{w_d^\top x}}{[\Sigma_{d} e^{w_d^\top x}]^2} = 0 …

2
Seja as estatísticas da ordem. Avalie ,
Seja a estatística de ordem para uma amostra aleatória de tamanho partir de uma distribuição normal com média e variância .X(1)≤X(2)X(1)≤X(2)X_{(1)}\leq X_{(2)}222μμ\muσ2σ2\sigma ^{2} Avalie , , , e .E(X(1))E⁡(X(1))\operatorname{E}(X_{(1)})E(X(2))E⁡(X(2))\operatorname{E}(X_{(2)})Var(X(1))Var⁡(X(1))\operatorname{Var}(X_{(1)})Var(X(2))Var⁡(X(2))\operatorname{Var}(X_{(2)})Cov(X(1),X(2))Cov⁡(X(1),X(2))\operatorname{Cov}(X_{(1)},X_{(2)}) Minha tentativa: Em geral, para uma amostra aleatória de tamanho com função de distribuição e função de densidade eu sei que …

1
Identificabilidade em um problema de regressão não linear
Suponha que eu esteja trabalhando com o seguinte modelo yi=α(1−exp(−βti))+γ(1−exp(−δti))+εiyi=α(1−exp⁡(−βti))+γ(1−exp⁡(−δti))+εiy_i = \alpha(1-\exp(-\beta t_i))+\gamma(1-\exp(-\delta t_i)) + \varepsilon_i . O é um gaussiano com média zero e estou tentando encontrar os melhores valores de ajuste de .εiεi\varepsilon_iα,β,γ,δα,β,γ,δ\alpha,\beta,\gamma,\delta Para concretização, digamos que este seja um modelo para a quantidade total de algumas espécies …

3
Computando a atualização do gradiente de ator no algoritmo DDPG (Deep Deterministic Policy Gradient)
Esta pergunta é referente ao documento Deepmind sobre DDPG: https://arxiv.org/pdf/1509.02971v5.pdf . A maioria (todas?) Das implementações do algoritmo DDPG que eu vi computam a atualização do gradiente na rede do ator por ∇(J)=∇μ(s|θ)(Q(s,μ(s|θ))∇θ(μ(s|θ))∇(J)=∇μ(s|θ)(Q(s,μ(s|θ))∇θ(μ(s|θ))\nabla(J)=\nabla_{\mu(s|\theta)}(Q(s,\mu(s|\theta))\nabla_{\theta}(\mu(s|\theta)), Onde θθ\theta representa os parâmetros da rede de atores, μμ\mu representa a rede de atores, QQQ representa …

1
Aprendizado de máquina monótono
Eu tenho um problema de classificação binária (aprendizado supervisionado), onde todos os meus recursos são booleanos, com o seguinte toque: Eu quero aprender um classificador que é monótono . Em outras palavras, alterar qualquer subconjunto de recursos de 0 para 1 nunca deve alterar a saída do classificador de 1 …


3
Significado de Raiz Quadrada de Covariância / Matrizes de Precisão
Digamos que é uma variável aleatória com covariância . Por definição , as entradas da matriz de covariância são covariâncias: Além disso, sabe-se que as entradas da precisão satisfazem: onde o lado direito é a covariância de com condicionado em todas as outras variáveis.X∈RnX∈RnX \in \mathbb{R}^nΣ∈Rn×nΣ∈Rn×n\Sigma \in \mathbb{R}^{n\times n}Σij=Cov(Xi,Xj).Σij=Cov(Xi,Xj). \Sigma_{ij} …


Ao utilizar nosso site, você reconhece que leu e compreendeu nossa Política de Cookies e nossa Política de Privacidade.
Licensed under cc by-sa 3.0 with attribution required.