Graduate Research
In ProgressFaithful or Fabricated
Hallucination Analysis in LLMs
Ongoing
Compared GPT-4.1-mini, LLaMA 3.1:8b, and Claude Haiku 4.5 on SQuAD 1.1 / 2.0 with exact-match, F1, and NLI-based faithfulness scoring. Found 9–15% hallucination rates and distinct calibration patterns — GPT under-abstains on unanswerable questions while LLaMA and Claude over-abstain on answerable ones. Currently extending with consistency checks and additional analyses.
PythonHuggingFaceNLIGPTLLaMAClaudeStreamlit
Graduate Research
Apr 2026Insurance Bias Audit
Demographic Bias in AI-Driven Claim Denials
NLP + structured-feature ML pipeline on the California DMHC IMR dataset predicting claim overturn outcomes. Trained AdaBoost, XGBoost, and LightGBM with SHAP-based interpretation to audit prediction behavior across demographic groups.
Pythonscikit-learnXGBoostLightGBMAdaBoostSHAPpandas
Personal Project
In ProgressIMR RAG Explorer
Production system over 42K+ California IMR Determinations
Ongoing
End-to-end RAG built from scratch — ingestion, Qdrant vector search with metadata filtering, grounded LLM generation with source citations, and CI/CD deployment. Anti-hallucination prompting and a calibrated similarity threshold for abstention, informed by my prior SQuAD evaluation research.
PythonFastAPIQdrantsentence-transformersGroq · Llama 3.1DockerGitHub Actions