Beruflich Dokumente
Kultur Dokumente
Projekt 5
- Zeitreihenprognose
Rajendra M Bhat
Für diese besondere Zuordnung sollen die Daten verschiedener Arten von Weinverkäufen im
20. Jahrhundert analysiert werden. Beide Daten stammen von derselben Firma, aber von
unterschiedlichen Weinen. Als Analyst bei ABC Estate Wines haben Sie die Aufgabe, den
Weinverkauf im 20. Jahrhundert zu analysieren und zu prognostizieren.
1 .Lesen Sie die Daten als geeignete Zeitreihendaten und zeichnen Sie die Daten auf.
Roséweinverkauf
Sparkling -Weinverkauf
2 . Führen Sie eine geeignete explorative Datenanalyse durch, um die Daten zu verstehen,
und führen Sie auch eine Zersetzung durch.
Roséweinverkauf
Der Datensatz hat 187 Datensätze und zwei Nullwerte. NULL-Werte wurden unterstellt
Trend für jeden Monat im Laufe der Jahre im Verkauf von Wein-Rose
Sektverkauf
3. Teilen Sie die Daten in Training und Test auf. Die Testdaten sollen
1991 beginnen.
Nach der Aufteilung des Zug- und Testdatensatzes hat der Zugdatensatz 132 Datensätze
und der Test 55 Datensätze
4. Erstellen Sie verschiedene exponentielle Glättungsmodelle auf den Trainingsdaten und bewerten Sie das
Modell mit RMSE auf den Testdaten. Andere Modelle wie Regression,naive Prognosemodelle, einfache
Durchschnittsmodelle usw. sollten ebenfalls auf den Trainingsdaten aufbauen und die Leistung der Testdaten
mithilfe von RMSE überprüfen.
Bitte versuchen Sie, so viele Modelle wie möglich und so viele Iterationen von Modellen wie möglich mit
unterschiedlichen Parametern zu erstellen.
Test RMSE
RegressionOnTime 15.280000
NaiveModel 79.741326
SimpleAverageModel 53.483727
2pointTrailingMovingAverage 11.529811
4pointTrailingMovingAverage 14.457115
6pointTrailingMovingAverage 14.571789
9pointTrailingMovingAverage 14.731914
Alpha=0,995,SimpleExponentialSmoothing 36.819844
Alpha=0,995,Beta=0,995:DoubleExponentialSmoothing 15.276679
Alpha=0,99,Beta=0,0001,Gamma=0,005:DoubleExponentialSmoothing 20.962011
Alpha=0,02,SimpleExponentialSmoothing 36.459396
Sektverkauf
Einfache Durchschnittsprognose
Gleitende Durchschnitte(MA)
Modellvergleichs-Plots
Test RMSE
RegressionOnTime 1389.140000
NaiveModel 3864.279352
SimpleAverageModel 1275.081804
2pointTrailingMovingAverage 813.400684
4pointTrailingMovingAverage 1156.589694
6pointTrailingMovingAverage 1283.927428
Test RMSE
9pointTrailingMovingAverage 1346.278315
Alpha=0,995,SimpleExponentialSmoothing 1316.034674
Alpha=0,995,Beta=0,995:DoubleExponentialSmoothing 2007.238526
Alpha=0,99,Beta=0,0001,Gamma=0,005:DoubleExponentialSmoothing 469.591976
Alpha=0,02,SimpleExponentialSmoothing 1279.495201
5. Überprüfen Sie die Stationarität der Daten, auf denen das Modell aufbaut, mithilfe geeigneter
statistischer Tests und erwähnen Sie auch die Hypothese für den statistischen Test. Wenn sich
herausstellt, dass die Daten nicht stationär sind, ergreifen Sie geeignete Maßnahmen, um sie stationär
zu machen. Überprüfen Sie die neuen Daten auf Stationarität und Kommentar. Hinweis: Die
Stationarität sollte bei alpha = 0,05 überprüft werden.
Um zu überprüfen, ob die Serie stationär ist, verwenden wir den Augmented Dickey Fuller (ADF)-Test, dessen
Null- und Alternativhypothese vereinfacht werden kann zu
•Nullhypothese H0: Zeitreihe ist nicht stationär
•Alternative Hypothese Ha: Zeitreihe ist stationär
Roséweinverkau
f
Ergebnisse Dickey-Fuller-Test:
Teststatistik p-Wert -1.360497
Verwendete Lags 0.601061
Anzahl der verwendeten 11.000000
Beobachtungen 175.000000
Kritischer Wert (1%) -3.468280
Kritischer Wert (5%) -2.878202
Kritischer Wert (10%) -2.575653
dtyp: float64
da p-Wert> 0,05, bei alpha 0,05 ist die Zeitreihe nicht stationär.
Wir können die nächsten Stufen der Differenzierung nehmen, um eine
Zeitreihe stationär zu machen.
Ergebnisse Dickey-Fuller-Test:
Teststatistik -45.050301
p-Wert 0.000000
Verwendete Lags 10.000000
Anzahl der verwendeten 175.000000
Beobachtungen -3.468280
Kritischer Wert (1%) -2.878202
Kritischer Wert (5%) -2.575653
Kritischer Wert (10%)
dtyp: float64
Roséweinverkauf
ARIMA-MODELL
AIC-Werte in absteigender Reihenfolge
param AIC
17 (3, 1, 3) 1273.194108
4 (1, 1, 2) 1277.359223
3 (1, 1, 1) 1277.775747
param AIC
9 (2, 1, 1) 1279.045689
10 (2, 1, 2) 1279.298694
5 (1, 1, 3) 1279.312635
15 (3, 1, 1) 1279.605966
16 (3, 1, 2) 1280.969245
11 (2, 1, 3) 1281.196226
1 (1, 0, 2) 1292.053210
7 (2, 0, 2) 1292.248055
2 (1, 0, 3) 1292.929011
6 (2, 0, 1) 1292.937195
14 (3, 0, 3) 1293.042709
8 (2, 0, 3) 1294.247938
0 (1, 0, 1) 1294.510585
12 (3, 0, 1) 1333.933193
13 (3, 0, 2) 1355.403813
ERGEBNISSE des
ARIMA-Modells
Abw. Variable: D.Rose Nr. Bemerkungen: 131 -
Modell: ARIMA(3, 1. 3) Protokollwahrscheinl 628.597
Methode: css-mle ichkeit 28.355
Datum: Sa, 06.03.2021 S.D. der 1273.194
Innovationen
AIC
Zeit: 14:46: 16 BIC 1296.196
Beispiel: 02-01-19 80 HQIC 1282.541
- 12-01-19 90
============== ============
koef std err z P>|z| [0.025
0.975]
--------------
-0.4906 0.088 -5.548 0.000 -0.664 -0.317
const
ar.L1.D.Rose -0.7244 0.086 -8.417 0.000 -0.893 -0.556
ar.L2.D.Rose -0.7218 0.086 -8.349 0.000 -0.891 -0.552
ar.L3.D.Rose 0.2763 0.085 3.236 0.001 0.109 0.444
ma.L1.D.Rose -0.0150 0.044 -0.338 0.735 -0.102 0.072
ma.L2.D.Rose 0.0150 0.044 0.339 0.734 -0.072 0.102
ma.L3.D.Rose -1.0000 0.046 -21.918 0.000 -1.089 -0.911
Wurzeln
============== =========
Echt Imaginär Modul
Häufigkeit
--------------
-0.5011 -0 .8661j 1.0006 -0.3335
AR.1
AR.2 -0.5011 +0 .8661j 1.0006 0.3335
AR.3 3.6147 -0 .0000j 3.6147 -0.0000
MA.1 1.0000 -0 .0000j 1.0000 -0.0000
MA.2 -0.4925 -0 .8703j 1.0000 -0.3320
MA.3 -0.4925 +0 .8703j 1.0000 0.3320
SARIMA-Modell
AIC-Werte in absteigender Reihenfolge (niedrigste AIC 10 Datensätze)
Die niedrigste AIC ist: 774.969 mit Param (0,1,2) und saisonal (2,1,2,12)
SARIMAX-Ergebnisse
======================== ==============
y Nr. Bemerkungen:
Abw. Variable:
Modell: ARIMAX(0, 1, 2)x(2, 1 , 2, 12) Protokollwahrsche 132
-380.485
Datum: Sa, 06 März 2021 inlichkeit
AIC 774.969
Zeit: 13:41:44 BIC 792.622
Beispiel: 0 HQIC 782.094
- 132
Kovarianz Typ: opg
========== =========
koef std err z P>|z| [0.025
0.975]
----------
-0.9524 0.184 -5.166 0.000 -1.314 -0.591
ma.L1
ma.L2 -0.0764 0.126 -0.605 0.545 -0.324 0.171
ar.S.L12 0.0480 0.177 0.271 0.786 -0.299 0.395
ar.S.L24 -0.0419 0.028 -1.513 0.130 -0.096 0.012
ma.S.L12 -0.7526 0.301 -2.503 0.012 -1.342 -0.163
ma.S.L24 -0.0721 0.204 -0.354 0.723 -0.471 0.327
sigma2 187.8679 45.274 4.150 0.000 99.132 276.604
========== ==============
(L1) (Q): 0.06 Jarque-Bera (JB ):
Ljung-Box
Prob(Q): 0.81 Prob(JB): 4.86
0.09
Heteroskedastizität (H): 0.91 Schiefe: 0.41
Prob(H) (zweiseitig): 0.79 Kurtosis: 3.77
Sektverkauf
ARIMA-MODELL
AIC-Werte in absteigender Reihenfolge
param AIC
8 (2, 1, 2) 2210.616954
7 (2, 1, 1) 2232.360490
param AIC
2 (0, 1, 2) 2232.783098
5 (1, 1, 2) 2233.597647
4 (1, 1, 1) 2235.013945
6 (2, 1, 0) 2262.035601
1 (0, 1, 1) 2264.906439
3 (1, 1, 0) 2268.528061
0 (0, 1, 0) 2269.582796
Niedrigste AIC ist : 1382.347780 mit Param (1,1,2) und saisonal 0,1,2,12)
SARIMAX-Ergebnisse
======================================= ==============
y Nr. Beobachtungen:
Abw. Variable: 132
Modell: SARIMAX(0, 1, 2)x(0, 1, 2, 12) Log Wahrscheinlichkeit
So, 28. Feb 2 021 -686.242
Datum: AIC
18: :38 1382.484
Zeit: 0 BIC
1395.093
Beispiel: 6 0 HQIC
1387.573
132
Kovarianz Typ: - opg
==========
koef std err z P>|z| [0.025 0. 975]
---------- -
-0.7223 0.107 .752 0.000 -0.932 -0 .513
ma.L1 6
ma.L2 -0.2292 0.137 - .671 0.095 -0.498 0.040
ma.S.L12 -0.4113 0.087 1
- .743 0.000 -0.581 -0 .241
ma.S.L24 -0.0419 0.138 4
- .304 0.761 -0.312 0.228
sigma2 1,736e +05 2,06e +04 0
8 .425 0.000 1. 33e+05 2,14e +05
Ljung-Box (L1) (Q): 0.02 Jarque-Bera (JB): 27.42
Prob(Q): 0.88 Prob(JB): 0.00
Heteroskedastizität (H): 0.84 Schiefe: 0.80
Prob(H) (zweiseitig): 0.62 Kurtosis: 5.15
Bewertung des Modells mit RMSE: RBSE für ARIMA Modell 321.48
7. Erstellen Sie ARIMA/SARIMA-Modelle basierend auf den Cut-off-Punkten von ACF und PACF auf
den Trainingsdaten und bewerten Sie dieses Modell auf den Testdaten mit RMSE.
Roséweinverkauf
Durch die Verwendung dieser Parameter (4,1,2) sind die Ergebnisse von ARIMA wie folgt:
==============
koef std err z P>|z| [0.025 0.975]
--------------
-0.1905 0.576 -0.331 0.741 -1.319 0.938
const
ar.L1.D.Rose 1.1685 0.087 13.391 0.000 0.997 1.340
ar.L2.D.Rose -0.3562 0.132 -2.693 0.007 -0.616 -0.097
ar.L3.D.Rose 0.1855 0.132 1.402 0.161 -0.074 0.445
ar.L4.D.Rose -0.2227 0.091 -2.443 0.015 -0.401 -0.044
ma.L1.D.Rose -1.9506 nan nan nan nan nan
ma.L2.D.Rose 1.0000 nan nan nan nan nan
Wurzeln
============== =========
Echt Imaginär Modul
Häufigkeit
--------------
1.1027 -0,4116j 1.1770 -0.0569
AR.1
AR.2 1.1027 +0,4116j 1.1770 0.0569
AR.3 -0.6863 -1,6643j 1.8003 -0.3122
AR.4 -0.6863 +1.6643j 1.8003 0.3122
MA.1 0.9753 -0,2209j 1.0000 -0.0355
MA.2 0.9753 +0,2209j 1.0000 0.0355
Durch die Verwendung dieser Parameter (4,1,2) und (4,1,2,12) sind die SARIMA-Ergebnisse wie folgt.
SARIMAX-Ergebnisse
Abw. Variable: y Nr. Bemerkungen: 132
Modell: SARIMAX(4, 1, 2)x(4, 1, 2, 12) Protokollwahrscheinlichkeit -277.661
Datum: So, 07. März 2021 AIC 581.322
Zeit: 14:22:21 BIC 609.983
Beispiel: 0 HQIC 592.663
- 132
Kovarianztyp: opg
======================= =======================================================
koef std err z P>|z| [0.025 0.975]
----------------------- ---------------------------------------------------------
ar.L1 -0.9742 0.199 -4.899 0.000 -1.364 -0.584
ar.L2 -0.1122 0.285 -0.394 0.694 -0.670 0.446
ar.L3 -0.1044 0.277 -0.377 0.706 -0.647 0.438
ar.L4 -0.1285 0.162 -0.794 0.427 -0.446 0.189
ma.L1 0.1605 328.137 0.000 1.000 -642.976 643.297
ma.L2 -0.8395 275.462 -0.003 0.998 -540.734 539.055
ar.S.L12 -0.1441 0.364 -0.396 0.692 -0.858 0.569
ar.S.L24 -0.3597 0.227 -1.587 0.113 -0.804 0.085
ar.S.L36 -0.2153 0.106 -2.039 0.041 -0.422 -0.008
ar.S.L48 -0.1195 0.093 -1.281 0.200 -0.302 0.063
ma.S.L12 -0.5159 0.343 -1.503 0.133 -1.189 0.157
ma.S.L24 0.2086 0.373 0.559 0.576 -0.523 0.940
sigma2 215.3512 7,07e +04 0.003 0.998 -1,38e +05 1,39e +05
======================= ===============
0.03 Jarque-Bera (JB):
Ljung-Box (L1) (Q): 0.86 Prob(JB): 2.41
Prob(Q): 0.49 Skew: 0.30
Heteroskedastizität (H): 0.10 Kurtosis: 0.32
Prob(H) (zweiseitig): 3.68
Sektverkauf
Durch die Verwendung dieser Parameter (3,1,2) sind die Ergebnisse von ARIMA wie folgt:
ERGEBNISSE des ARIMA-Modells
Durch die Verwendung dieser Parameter (3,1,2) und (3,1,2,12) sind die SARIMA-Ergebnisse wie folgt.
SARIMAX-Ergebnisse
8. Erstellen Sie eine Tabelle (erstellen Sie einen Datenrahmen) mit allen gebauten Modellen mit ihren
entsprechenden Parametern und den jeweiligen RMSE-Werten auf den Testdaten.
RegressionOnTime 15.280000
NaiveModel 79.741326
SimpleAverageModel 53.483727
2pointTrailingMovingAverage 11.529811
4pointTrailingMovingAverage 14.457115
6pointTrailingMovingAverage 14.571789
9pointTrailingMovingAverage 14.731914
Alpha=0,995,SimpleExponentialSmoothing 36.819844
Alpha=0,995,Beta=0,995:DoubleExponentialSmoothing 15.276679
Alpha=0,99,Beta=0,0001,Gamma=0,005:DoubleExponentialSmoothing 20.962011
Alpha=0,02,SimpleExponentialSmoothing 36.459396
ARIMA(3, 1, 3) 15.99
ARIMA(4, 1, 2) 33.97
RegressionOnTime 1389.140000
NaiveModel 3864.279352
SimpleAverageModel 1275.081804
Test RMSE
2pointTrailingMovingAverage 813.400684
4pointTrailingMovingAverage 1156.589694
6pointTrailingMovingAverage 1283.927428
9pointTrailingMovingAverage 1346.278315
Alpha=0,995,SimpleExponentialSmoothing 1316.034674
Alpha=0,995,Beta=0,995:DoubleExponentialSmoothing 2007.238526
Alpha=0,99,Beta=0,0001,Gamma=0,005:DoubleExponentialSmoothing 469.591976
Alpha=0,02,SimpleExponentialSmoothing 1279.495201
ARIMA(2, 1, 2) 1375.03
ARIMA(3, 1, 2) 1375.10
9. Basierend auf der Modellbildungsübung, bauen Sie das/die optimalste (n) Modell(e) auf den
vollständigen Daten auf und prognostizieren Sie 12 Monate in die Zukunft mit geeigneten
Konfidenzintervallen/-bändern.
Da der Rosendatensatz eine klare Komponente der Saisonalität SARIM hat. Daher wird das SARIMA-Modell mit den
Parametern (0,1,2)x(2,1,2,12) für die Prognose von Zeitreihen ausgewählt, und die Modelldetails sind wie folgt.
SARIMAX-Ergebnisse
====================== ==============
Rose Nr. Bemerkungen:
Abw. Variable:
Modell: SARIMAX(0, 1, 2)x(2, 1, 2, 12) Protokollwahrscheinlichke 187
-588.604
Datum: Sa, 06.03.2021 it
AIC 1191.208
Zeit: 13:41:48 BIC 1212.142
Beispiel: 01-01-1980 HQIC 1199.714
- 07-01-1995
Kovarianz Typ: opg
========== =========
koef std err z P>|z| [0.025
0.975]
---------- ---------
-0.8254 0.080 -10.334 0.000 -0.982
ma.L1
ma.L2 -0.0807 0.086 -0.934 0.350 -0.250 -0.669
0.089
ar.S.L12 0.0635 0.160 0.398 0.691 -0.249 0.376
ar.S.L24 -0.0340 0.019 -1.790 0.074 -0.071 0.003
ma.S.L12 -0.6953 0.207 -3.360 0.001 -1.101 -0.290
ma.S.L24 -0.0547 0.150 -0.365 0.715 -0.348 0.239
sigma2 166.0900 17.899 9.279 0.000 131.008 201.172
========== ==============
(L1) (Q): 0.07 Jarque-Bera (JB):
Ljung-Box 8.28
Prob(Q): 0.79 Prob(JB): 0.02
Heteroskedastizität (H): 0.51 Schiefe: 0.33
Prob(H) (zweiseitig): 0.02 Kurtosis: 3.95
Die prognostizierten Verkäufe von Rose für die nächsten 12 Monate sind wie folgt
mittel
Rose mean_se mean_ci_lower mean_ci_upper
wert
1995-08-01 42.984338 12.890006 17.720391 68.248285
Da Sparkling-Verkaufsdaten eine saisonale Komponente haben. Daher wird vorgeschlagen, das SARIMA-Modell mit
Parametern (0,1,2) (0, 1, 2, 12) für die Prognose für die nächsten 12 Monate unter Verwendung vollständiger Daten zu
verwenden. Details zum Modell finden Sie unter.
SARIMAXErgebnisse
====================== ===============
Funkelnd Nr. Bemerkungen:
Abw. Variable:
Modell: SARIMAX(0, 1, 2)x(0, 1, 2, 12) Prot Wahrscheinlichkeit 187
-1087.003
Datum: So, 28.02.2021 okoll
AIC 2184.006
Zeit: 18:26:36 BIC 2198.958
Beispiel: 01-01-1980 HQIC 2190.081
- 07-01-1995
Kovarianz Typ: opg
========== ==========
koef std err z P>|z| [0.025
0.975]
----------
-0.9094 0.104 -8.713 0.000 -1.114 -0.705
ma.L1
ma.L2 -0.1316 0.087 -1.507 0.132 -0.303 0.040
ma.S.L12 -0.5456 0.065 -8.393 0.000 -0.673 -0.418
ma.S.L24 -0.0202 0.084 -0.241 0.810 -0.185 0.145
sigma2 1.419e+05 1,32e +04 10.755 0.000 1,16e +05 1,68e +05
========== ===============
(L1) (Q): 0.01 Jarque-Bera (JB):
Ljung-Box
Prob(Q): 0.91 Prob(JB): 49.28
0.00
Heteroskedastizität (H) : 0.79 Schiefe: 0.74
Prob(H) (zweiseitig): 0.42 Kurtosis: 5.41
Die prognostizierten Verkäufe von Sparkling für die nächsten 12 Monate sind wie folgt
mittel
Funkelnd mean_se mean_ci_lower mean_ci_upper
wert
1995-08-01 1874.535574 390.423218 1109.320128 2639.751020
10. Kommentieren Sie das so erstellte Modell und berichten Sie über Ihre Ergebnisse und schlagen Sie
die Maßnahmen vor, die das Unternehmen für zukünftige Verkäufe ergreifen sollte.
Die Umsatzentwicklung von Rose nimmt im Berichtszeitraum kontinuierlich ab. Eine detaillierte Studie kann erforderlich
sein, um festzustellen, ob der abnehmende Trend auf eine Änderung der Kundenpräferenz oder auf eine Substitution
zurückzuführen ist. Saisonabhängigkeit der Verkäufe wird beobachtet, und höhere Verkäufe werden am Ende des Jahres
beibehalten. Einige Werbemaßnahmen und Verbesserungs- / Qualitätsverbesserungsmittel im Produkt können
untersucht werden, um neue Kunden der jungen Generation zu gewinnen.