{"metadata":{"kernelspec":{"language":"python","display_name":"Python 3","name":"python3"},"language_info":{"name":"python","version":"3.10.14","mimetype":"text/x-python","codemirror_mode":{"name":"ipython","version":3},"pygments_lexer":"ipython3","nbconvert_exporter":"python","file_extension":".py"},"kaggle":{"accelerator":"none","dataSources":[{"sourceId":84896,"databundleVersionId":10305135,"sourceType":"competition"}],"dockerImageVersionId":30804,"isInternetEnabled":false,"language":"python","sourceType":"notebook","isGpuEnabled":false}},"nbformat_minor":4,"nbformat":4,"cells":[{"cell_type":"code","source":"# This Python 3 environment comes with many helpful analytics libraries installed\n# It is defined by the kaggle/python Docker image: https://github.com/kaggle/docker-python\n# For example, here's several helpful packages to load\n\nimport numpy as np # linear algebra\nimport pandas as pd # data processing, CSV file I/O (e.g. pd.read_csv)\n\n# Input data files are available in the read-only \"../input/\" directory\n# For example, running this (by clicking run or pressing Shift+Enter) will list all files under the input directory\n\nimport os\nfor dirname, _, filenames in os.walk('/kaggle/input'):\n    for filename in filenames:\n        print(os.path.join(dirname, filename))\n\n# You can write up to 20GB to the current directory (/kaggle/working/) that gets preserved as output when you create a version using \"Save & Run All\" \n# You can also write temporary files to /kaggle/temp/, but they won't be saved outside of the current session","metadata":{"_uuid":"8f2839f25d086af736a60e9eeb907d3b93b6e0e5","_cell_guid":"b1076dfc-b9ad-4769-8c92-a6c4dae69d19","trusted":true,"execution":{"iopub.status.busy":"2024-12-11T08:07:31.922922Z","iopub.execute_input":"2024-12-11T08:07:31.923389Z","iopub.status.idle":"2024-12-11T08:07:33.162398Z","shell.execute_reply.started":"2024-12-11T08:07:31.923342Z","shell.execute_reply":"2024-12-11T08:07:33.161275Z"}},"outputs":[],"execution_count":null},{"cell_type":"code","source":"import numpy as np\nimport pandas as pd\nimport seaborn as sns\nimport matplotlib.pyplot as plt\nfrom sklearn.preprocessing import StandardScaler, LabelEncoder\nfrom sklearn.model_selection import train_test_split\nfrom sklearn.linear_model import LinearRegression\nfrom sklearn.metrics import mean_squared_error, r2_score","metadata":{"trusted":true,"execution":{"iopub.status.busy":"2024-12-11T08:07:44.489617Z","iopub.execute_input":"2024-12-11T08:07:44.490031Z","iopub.status.idle":"2024-12-11T08:07:45.568911Z","shell.execute_reply.started":"2024-12-11T08:07:44.489996Z","shell.execute_reply":"2024-12-11T08:07:45.567771Z"}},"outputs":[],"execution_count":null},{"cell_type":"code","source":"train = pd.read_csv(\"/kaggle/input/playground-series-s4e12/train.csv\")\ntest = pd.read_csv(\"/kaggle/input/playground-series-s4e12/test.csv\")","metadata":{"trusted":true,"execution":{"iopub.status.busy":"2024-12-11T08:07:49.344245Z","iopub.execute_input":"2024-12-11T08:07:49.345198Z","iopub.status.idle":"2024-12-11T08:07:59.512636Z","shell.execute_reply.started":"2024-12-11T08:07:49.345156Z","shell.execute_reply":"2024-12-11T08:07:59.511494Z"}},"outputs":[],"execution_count":null},{"cell_type":"code","source":"train['Policy Start Date'] = pd.to_datetime(train['Policy Start Date'], errors='coerce')\ntrain['Policy Start Date'] = train['Policy Start Date'].dt.normalize()\n\ntest['Policy Start Date'] = pd.to_datetime(test['Policy Start Date'], errors='coerce')\ntest['Policy Start Date'] = test['Policy Start Date'].dt.normalize()","metadata":{"trusted":true,"execution":{"iopub.status.busy":"2024-12-11T08:08:02.635537Z","iopub.execute_input":"2024-12-11T08:08:02.635956Z","iopub.status.idle":"2024-12-11T08:08:03.40523Z","shell.execute_reply.started":"2024-12-11T08:08:02.635916Z","shell.execute_reply":"2024-12-11T08:08:03.404115Z"}},"outputs":[],"execution_count":null},{"cell_type":"code","source":"train_num = train.select_dtypes(include=['float64', 'int64'])\ntest_num = test.select_dtypes(include=['float64', 'int64'])","metadata":{"trusted":true,"execution":{"iopub.status.busy":"2024-12-11T08:08:05.33584Z","iopub.execute_input":"2024-12-11T08:08:05.336223Z","iopub.status.idle":"2024-12-11T08:08:05.404039Z","shell.execute_reply.started":"2024-12-11T08:08:05.336186Z","shell.execute_reply":"2024-12-11T08:08:05.403186Z"}},"outputs":[],"execution_count":null},{"cell_type":"code","source":"train_num.isnull().sum()","metadata":{"trusted":true,"execution":{"iopub.status.busy":"2024-12-11T08:08:06.636497Z","iopub.execute_input":"2024-12-11T08:08:06.637421Z","iopub.status.idle":"2024-12-11T08:08:06.670103Z","shell.execute_reply.started":"2024-12-11T08:08:06.637382Z","shell.execute_reply":"2024-12-11T08:08:06.668971Z"}},"outputs":[],"execution_count":null},{"cell_type":"code","source":"test_num.isnull().sum()","metadata":{"trusted":true,"execution":{"iopub.status.busy":"2024-12-11T08:08:08.230116Z","iopub.execute_input":"2024-12-11T08:08:08.230887Z","iopub.status.idle":"2024-12-11T08:08:08.249111Z","shell.execute_reply.started":"2024-12-11T08:08:08.23085Z","shell.execute_reply":"2024-12-11T08:08:08.248122Z"}},"outputs":[],"execution_count":null},{"cell_type":"code","source":"train_num['Annual Income'].fillna(train_num['Annual Income'].median(), inplace=True)\ntrain_num['Vehicle Age'].fillna(train_num['Vehicle Age'].mean(), inplace=True)\ntrain_num['Insurance Duration'].fillna(train_num['Insurance Duration'].mean(), inplace=True)\ntrain_num = train_num.dropna()\n\ntest_num['Age'].fillna(test_num['Age'].mean(), inplace=True)\ntest_num['Annual Income'].fillna(test_num['Annual Income'].median(), inplace=True)\ntest_num['Number of Dependents'].fillna(test_num['Number of Dependents'].mean(), inplace=True)\ntest_num['Health Score'].fillna(test_num['Health Score'].mean(), inplace=True)\ntest_num['Previous Claims'].fillna(test_num['Previous Claims'].median(), inplace=True)\ntest_num['Vehicle Age'].fillna(test_num['Vehicle Age'].median(), inplace=True)\ntest_num['Credit Score'].fillna(test_num['Credit Score'].mean(), inplace=True)\ntest_num['Insurance Duration'].fillna(test_num['Insurance Duration'].median(), inplace=True)","metadata":{"trusted":true,"execution":{"iopub.status.busy":"2024-12-11T08:08:09.9763Z","iopub.execute_input":"2024-12-11T08:08:09.977218Z","iopub.status.idle":"2024-12-11T08:08:10.205224Z","shell.execute_reply.started":"2024-12-11T08:08:09.977176Z","shell.execute_reply":"2024-12-11T08:08:10.204173Z"}},"outputs":[],"execution_count":null},{"cell_type":"code","source":"def remove_outliers(df, column):\n    Q1 = df[column].quantile(0.25)\n    Q3 = df[column].quantile(0.75)\n    IQR = Q3 - Q1\n    lower_bound = Q1 - 1 * IQR\n    upper_bound = Q3 + 1 * IQR\n    return df[(df[column] >= lower_bound) & (df[column] <= upper_bound)]\n\nfor column in ['Annual Income', 'Previous Claims']:\n    train_num = remove_outliers(train_num, column)\n\nscaler = StandardScaler()\ntrain_num_scaled = train_num.columns\ntrain_num[train_num_scaled] = scaler.fit_transform(train_num[train_num_scaled])\n\ntest_num_scaled = test_num.columns\ntest_num[test_num_scaled] = scaler.fit_transform(test_num[test_num_scaled])\n\nplt.figure(figsize=(15, 10))\nsns.boxplot(data=train_num)\nplt.xticks(rotation=90)\nplt.show()","metadata":{"trusted":true,"execution":{"iopub.status.busy":"2024-12-11T08:08:24.801122Z","iopub.execute_input":"2024-12-11T08:08:24.801506Z","iopub.status.idle":"2024-12-11T08:08:25.858691Z","shell.execute_reply.started":"2024-12-11T08:08:24.801473Z","shell.execute_reply":"2024-12-11T08:08:25.857597Z"}},"outputs":[],"execution_count":null},{"cell_type":"code","source":"train_cat = train.select_dtypes(include=['object'])\ntest_cat = test.select_dtypes(include=['object'])","metadata":{"trusted":true,"execution":{"iopub.status.busy":"2024-12-11T08:08:30.873175Z","iopub.execute_input":"2024-12-11T08:08:30.873875Z","iopub.status.idle":"2024-12-11T08:08:31.693612Z","shell.execute_reply.started":"2024-12-11T08:08:30.873834Z","shell.execute_reply":"2024-12-11T08:08:31.692731Z"}},"outputs":[],"execution_count":null},{"cell_type":"code","source":"train_cat = train_cat.dropna()","metadata":{"trusted":true,"execution":{"iopub.status.busy":"2024-12-11T08:08:34.86296Z","iopub.execute_input":"2024-12-11T08:08:34.863767Z","iopub.status.idle":"2024-12-11T08:08:35.618616Z","shell.execute_reply.started":"2024-12-11T08:08:34.863725Z","shell.execute_reply":"2024-12-11T08:08:35.617394Z"}},"outputs":[],"execution_count":null},{"cell_type":"code","source":"label_encoder = LabelEncoder()\n\ntrain_cat['Education Level'] = label_encoder.fit_transform(train_cat['Education Level'])\ntest_cat['Education Level'] = label_encoder.transform(test_cat['Education Level'])\n\ntrain_cat['Exercise Frequency'] = label_encoder.fit_transform(train_cat['Exercise Frequency'])\ntest_cat['Exercise Frequency'] = label_encoder.transform(test_cat['Exercise Frequency'])\n\ntrain_cat = pd.get_dummies(train_cat, columns=['Gender','Marital Status','Occupation', 'Location', \n                                               'Policy Type','Customer Feedback', 'Smoking Status', 'Property Type'], drop_first=True)\ntest_cat = pd.get_dummies(test_cat, columns=['Gender','Marital Status','Occupation', 'Location', \n                                             'Policy Type','Customer Feedback', 'Smoking Status', 'Property Type'], drop_first=True)","metadata":{"trusted":true,"execution":{"iopub.status.busy":"2024-12-11T08:08:37.458053Z","iopub.execute_input":"2024-12-11T08:08:37.458439Z","iopub.status.idle":"2024-12-11T08:08:39.17932Z","shell.execute_reply.started":"2024-12-11T08:08:37.458403Z","shell.execute_reply":"2024-12-11T08:08:39.178379Z"}},"outputs":[],"execution_count":null},{"cell_type":"code","source":"train_final = pd.concat([train_num, train_cat], axis=1)\ntest_final = pd.concat([test_num, test_cat], axis=1)\n\ny_train = train['Premium Amount']\n\ntrain_final = train_final.dropna()\ny_train = y_train[train_final.index] \n\ntest_final = test_final.dropna()\n\nprint(train_final.isnull().sum())\nprint(test_final.isnull().sum())\n\nX_train = train_final\nX_test = test_final\n\nprint(\"Features (X_train) shape:\", X_train.shape)\nprint(\"Features (X_test) shape:\", X_test.shape)\nprint(\"Target (y_train) shape:\", y_train.shape)\n\nX_train_split, X_val_split, y_train_split, y_val_split = train_test_split(X_train, y_train, test_size=0.2, random_state=42)\n\nprint(\"Training features (X_train_split) shape:\", X_train_split.shape)\nprint(\"Validation features (X_val_split) shape:\", X_val_split.shape)\nprint(\"Training target (y_train_split) shape:\", y_train_split.shape)\nprint(\"Validation target (y_val_split) shape:\", y_val_split.shape)","metadata":{"trusted":true,"execution":{"iopub.status.busy":"2024-12-11T08:08:41.852414Z","iopub.execute_input":"2024-12-11T08:08:41.852791Z","iopub.status.idle":"2024-12-11T08:08:43.691142Z","shell.execute_reply.started":"2024-12-11T08:08:41.852757Z","shell.execute_reply":"2024-12-11T08:08:43.689974Z"}},"outputs":[],"execution_count":null},{"cell_type":"code","source":"model = LinearRegression()\nmodel.fit(X_train_split, y_train_split)\ny_val_pred = model.predict(X_val_split)\n\nmse = mean_squared_error(y_val_split, y_val_pred)\nr2 = r2_score(y_val_split, y_val_pred)\n\nprint(f\"Mean Squared Error (MSE): {mse}\")\nprint(f\"R-squared (R2): {r2}\")","metadata":{"trusted":true,"execution":{"iopub.status.busy":"2024-12-11T08:08:46.666831Z","iopub.execute_input":"2024-12-11T08:08:46.66775Z","iopub.status.idle":"2024-12-11T08:08:47.84317Z","shell.execute_reply.started":"2024-12-11T08:08:46.667711Z","shell.execute_reply":"2024-12-11T08:08:47.839643Z"}},"outputs":[],"execution_count":null},{"cell_type":"code","source":"X_full_train = pd.concat([X_train_split, X_val_split])\ny_full_train = pd.concat([y_train_split, y_val_split])\n\ncommon_features = X_full_train.columns.intersection(X_test.columns)\nX_full_train = X_full_train[common_features]\nX_test = X_test[common_features]\n\nmodel.fit(X_full_train, y_full_train)\n\ntest_indices = test_final.index\n\ny_test_pred = model.predict(X_test)","metadata":{"trusted":true,"execution":{"iopub.status.busy":"2024-12-11T08:08:52.717877Z","iopub.execute_input":"2024-12-11T08:08:52.718228Z","iopub.status.idle":"2024-12-11T08:08:54.306652Z","shell.execute_reply.started":"2024-12-11T08:08:52.718197Z","shell.execute_reply":"2024-12-11T08:08:54.305302Z"}},"outputs":[],"execution_count":null},{"cell_type":"code","source":"submission = pd.DataFrame({\n    'id': test['id'],\n    'Premium Amount': y_test_pred\n})\n\nsubmission.to_csv('submission.csv', index=False)","metadata":{"trusted":true,"execution":{"iopub.status.busy":"2024-12-11T08:08:57.292526Z","iopub.execute_input":"2024-12-11T08:08:57.293489Z","iopub.status.idle":"2024-12-11T08:08:58.975061Z","shell.execute_reply.started":"2024-12-11T08:08:57.29345Z","shell.execute_reply":"2024-12-11T08:08:58.974162Z"},"_kg_hide-input":true,"_kg_hide-output":true},"outputs":[],"execution_count":null}]}