{
  "objective": "Analyze why certain Indian states account for most number of expats by examining economic, social, and historical factors, and how trends have changed over time",
  "writeup_format": "Slides",
  "steps": [
    {
      "number": 1,
      "name": "Data Acquisition",
      "description": "Collect state-wise emigration data and socio-economic indicators from MEA, Census, World Bank, UN databases",
      "outputs": ["data/raw/*.csv", "data/raw/*.json"]
    },
    {
      "number": 2,
      "name": "Data Processing",
      "description": "Clean, standardize, and merge datasets into unified format",
      "outputs": ["data/processed/unified_dataset.csv"]
    },
    {
      "number": 3,
      "name": "Exploratory Data Analysis",
      "description": "Generate summary statistics and identify patterns",
      "outputs": ["results/eda_summary.txt"]
    },
    {
      "number": 4,
      "name": "Trend Analysis",
      "description": "Analyze temporal changes in emigration patterns and state rankings",
      "outputs": ["results/trend_analysis.csv"]
    },
    {
      "number": 5,
      "name": "Statistical Analysis",
      "description": "Correlation and regression analysis to identify drivers of emigration",
      "outputs": ["results/statistical_results.json", "results/regression_summary.txt"]
    },
    {
      "number": 6,
      "name": "Visualization",
      "description": "Create publication-quality figures for slides",
      "outputs": ["figures/*.png"]
    },
    {
      "number": 7,
      "name": "Documentation",
      "description": "Write comprehensive README with findings",
      "outputs": ["README.md"]
    }
  ],
  "success_criteria": [
    "Compiled time-series dataset covering major Indian states (2010-2023)",
    "Statistical identification of primary drivers with correlation coefficients and p-values",
    "Clear visualizations of emigration trends and correlations",
    "Comprehensive documentation with reproducible methods",
    "All outputs prepared for slides generation by writing agent"
  ],
  "test_plan": [
    "Verify data completeness (no major states missing)",
    "Validate statistical assumptions (normality, independence)",
    "Check visualization quality (300 DPI, clear labels)",
    "Confirm reproducibility (re-run all scripts)"
  ],
  "factors_analyzed": {
    "economic": ["GDP per capita", "Unemployment rate", "Agricultural distress"],
    "social": ["Literacy rate", "English proficiency", "Higher education density"],
    "historical": ["Existing diaspora", "Remittances", "Migration networks"]
  }
}
