Data Engineering & ML Analytics Portfolio

Shaun Lin

Building high-performance data pipelines, predictive machine learning models, and interactive analytical dashboards.

Tech Stack

Data Engineering
Python
Analytics
Cloud
APIs & ETL
Pipelines
Version Control
Automation
Career Trajectory

Experience & Impact Timeline

Analytics architecture, data quality engineering, and financial data foundations.

Jan 2025 – PresentNAAAP Boston

Associate Director of Data Insights (Volunteer)

  • Built and led NAAAP Boston's data engineering team, driving data strategy and technical execution.
  • Owned design and deployment of 1st end-to-end data stack leveraging Airflow, BigQuery, and dbt (enabled 10x data volume processing).
  • Established Kanban workflow and DE code reviews/version control, creating a predictable project roadmap.
AirflowBigQuerydbtDE LeadershipKanban
May 2025Georgia Institute of Technology

Master of Science in Analytics

  • Advanced analytical modeling, machine learning, statistical computing, and data architecture.
MS AnalyticsMachine LearningStatistical Computing
Jun 2022 – Jun 2024American Student Assistance

Data Analytics Engineer

  • Optimized 10+ dbt models and Snowflake DB structures, reducing average model build time by 20% and accelerating data retrieval by 30%.
  • Orchestrated integration of 10+ disparate data sources through automated pipelines, establishing a unified source of truth.
  • Engineered underlying data models and written performance-tuned SQL for executive Tableau reporting.
SnowflakedbtSQL OptimizationTableauETL Pipelines
Feb 2022 – Apr 2022Kafene

Data Quality Engineer

  • Improved data integrity by writing and executing Python & SQL scripts to detect anomalies.
  • Expanded data quality test coverage by updating and committing revised SQL scripts to GitHub.
  • Created comprehensive Data Dictionary and detailed relational database diagrams (ERDs).
PythonSQLData QualityERD ModelingGit
Aug 2020Springboard

Data Science Bootcamp Certification

  • Intensive data science, Python, pandas, machine learning algorithms, and hands-on capstone projects.
PythonPandasMachine LearningData Science
Dec 2017 – Dec 2019Biogen

Data Analyst

  • Remediated data quality issues across 10+ departments to ensure business compliance and accuracy.
  • Reduced manual effort by 50% by engineering automated data migration solutions using Excel VBA.
  • Established and monitored key performance indicators for data migration projects.
Data RemediationExcel VBAKPI TrackingMigration
2014 – 2017Yellowstone Capital • FDM Group • GE Healthcare Contracts

Financial & Data Analyst / IT Consultant

  • Financial data analysis and quantitative risk evaluation at Yellowstone Capital post-graduation.
  • Completed intensive IT & business intelligence training at FDM Group in SQL and analytical reporting.
  • Executed data analysis and reporting contracts across healthcare and technology domains (GE Healthcare, CCS Global Tech).
Financial AnalyticsSQLRisk EvaluationData Reporting
May 2014University of Massachusetts Amherst

B.B.A. in Finance

  • Bachelor of Business Administration in Finance. Financial modeling, business economics, and quantitative analysis.
FinanceEconomicsQuantitative Analysis
AI Systems & Interactive Labs

🤖 AI Use Cases & Interactive Demos

Autonomous workflows, neural speech synthesis pipelines (Edge-TTS), and active Socratic sparring engines solving real retention & productivity friction.

AI SystemsSchema Certified

Retail & Supply Chain Intelligence Pipeline

Local-First Automated ETL, Relational Star Schema & SQL Audit Engine

Production-grade, automated data pipeline analyzing 100,000+ Brazilian e-commerce orders (Olist). Features strict SQLAlchemy type mapping, automated two-way data integrity reconciliation (DataFrame rows vs. SQL distinct keys), Kimball star schema modeling, and advanced analytical SQL business audits.

Technical Architecture Highlights

  • Local-First Multi-Engine Support: 1-Click Execution across SQLite, DuckDB, and MySQL
  • Automated Two-Way Data Surgery & Integrity Verification (DF Rows vs SQL Rows)
  • Production Kimball Star Schema with 4 Fact Tables & 3 Dimension Tables

Data Integrity

100% Passed

Orders Analyzed

100,000+

PythonSQLAlchemy 2.0SQLiteDuckDBMySQLStar SchemaAnalytical SQLAutomated Testing
AI Systems

Power BI PL-300 Diagnostic & Simulation Studio

Interactive 60-Question Sparring & Active Feynman Recall Engine

A client-side interactive examination studio solving passive learning drop-off for Power BI analysts. Features real-time Study vs. Exam modes, DAX filter context trap diagnostics, and scoring analytics.

Technical Architecture Highlights

  • 60-Question Curated PL-300 Diagnostic Problem Bank
  • Instant Mode Toggling: Study Mode (Explanations) vs. Timed Exam Mode
  • DAX Filter Context Trap Deconstruction & Socratic Sparring

Question Bank

60 Questions

Exam Domains

4 Modules

JavaScriptTailwind CSSDAXPower BIActive Recall
AI Systems

Bilingual Neural Audiobook & Socratic Reader

Multi-Language Speechify-Style Knowledge Engine with Active Recall

Dual-language neural voice player solving screen fatigue and commute retention loss. Combines Edge-TTS high-fidelity models (en-US / zh-CN) with in-player Socratic oral recall drills.

Technical Architecture Highlights

  • Bilingual Streaming: English (Four Thousand Weeks) & Chinese (终身学习)
  • Microsoft Edge-TTS High-Fidelity Neural Speech Synthesis
  • In-Player Socratic Recall Drills Grounding Book Concepts

Retention Boost

10% ➔ 80%

Languages

EN & ZH

Web Audio APIEdge-TTSPythonTailwind CSSSocratic Sparring
AI Systems

Career Pulse · Career Anxiety & Persona Quiz

Interactive Behavioral Diagnostic Engine & 80/20 Actionable Breakthrough Lab

A mobile-first behavioral assessment and diagnostic tool helping job seekers identify hidden psychological bottlenecks (imposter syndrome, resume perfectionism paralysis, spray-and-pray burnout). Features real-time state machines, 1080x1440 HD canvas shareable poster export, and zero-cost client-side scoring.

Technical Architecture Highlights

  • 6 Immersive Scenario Questions Diagnosing Job Search Friction & Inaction
  • 4 Granular Psychological Archetypes with Actionable 80/20 Breakthrough Playbooks
  • High-Performance HTML5 Canvas Rendering 1080x1440 Shareable Social Posters

Diagnostic Scenarios

6 Questions

Persona Archetypes

4 Archetypes

JavaScriptHTML5 CanvasPico CSSState MachineQRCode.jsLocal-First
Analytics Engineering & ML

📊 Data Analytics & Machine Learning Projects

End-to-end data pipelines, unsupervised 3D clustering, regression modeling, and financial box office ROI analytics.

Machine Learning

Customer Segmentation & 3D Clustering Dashboard

K-Means & Hierarchical Clustering Analysis with Interactive 3D Visualizations

A high-impact data science dashboard analyzing customer behavioral datasets using unsupervised machine learning (K-Means & Hierarchical Clustering). Includes optimal cluster estimation (Elbow & Silhouette analysis) and interactive 3D PCA projections.

Technical Architecture Highlights

  • Optimal Cluster Validation via Elbow Method & Silhouette Analysis
  • Interactive 3D PCA Dimensionality Reduction Scatterplot
  • Customer Behavioral Persona Mapping (Champions, At-Risk, Loyal)

Optimal Clusters (k)

k = 4

Silhouette Score

0.68

PythonScikit-LearnK-Means3D PlotlyPCAStreamlit
Machine Learning

Hybrid Book Recommender System

Collaborative Filtering & Content-Based Recommendation Engine

A personalized recommendation engine analyzing user rating matrices to surface tailored reading suggestions using cosine similarity, singular value decomposition (SVD), and content metadata fallback.

Technical Architecture Highlights

  • Matrix Sparsity Reduction on 1.1M User-Item Interactions
  • Item-Item Cosine Similarity & SVD Factorization
  • Content-Based Metadata Matching for Cold-Start Mitigation

Catalog Size

270,000+ Books

User Ratings

1.1M Records

PythonRecommendation SystemsCosine SimilarityJupyterFlaskSVD
Machine Learning

Real Estate Valuation & Pricing Model

Advanced Regression & Feature Engineering for Property Pricing

End-to-end predictive modeling pipeline utilizing Ridge, Lasso, Random Forest, and LightGBM regressors to estimate residential property valuations with high precision.

Technical Architecture Highlights

  • 35+ Engineered Structural, Amenity, and Interaction Features
  • Log-Transformed Target Distribution Mitigation
  • 10-Fold Cross-Validated Model Ensemble Comparison

Test R² Score

0.912

RMSE Reduction

-24.6%

PythonPandasScikit-LearnLightGBMXGBoostFeature Engineering
Data Analytics

TMDB Box Office & Movie Revenue Analytics

Exploratory Data Analysis & Financial ROI Modeling on 10,000+ Film Records

Comprehensive exploratory data analysis examining financial drivers, genre profitability, runtime trends, and director ROI metrics across decades of cinema history.

Technical Architecture Highlights

  • 10,800+ Movie Financial Records Ingested & Cleaned
  • CPI Inflation-Adjusted Budget & Revenue Transformations
  • Genre Profitability Matrices & Director Return-on-Investment (ROI)

Films Analyzed

10,800+

Highest ROI Genre

Animation / Sci-Fi

PythonPandasMatplotlibSeabornEDAStatistical Testing