{"slug":"jeremylongshore-langchain-eval-harness","source_name":"jeremylongshore/langchain-eval-harness","name":"Jeremylongshore/Langchain Eval Harness","description":"Build reproducible evaluation pipelines for LangChain 1.0 chains and LangGraph 1.0\nagents — golden datasets, LangSmith evaluate(), ragas RAG metrics, deepeval\nLLM-as-judge, agent trajectory analysis, and CI gating on quality regressions.\nUse when setting up quality measurement for a new chain, diagnosing regression\nafter a model switch, or building an evaluation gate for a pull request.\nTrigger with \"langchain eval\", \"langsmith evaluate\", \"ragas\", \"llm-as-judge\",\n\"agent trajectory eval\", \"eval r","version":1,"lift":{"pass_rate_delta_pts":39.13,"pass_rate_pct":87,"total_cases":23,"passed_cases":20,"tokens_delta_pct":104.7,"turns_delta_pct":0,"verdict":"mixed","benchmark_model":"gemini-3.6-flash","grading_method":"judged","completed_at":"2026-08-30T19:15:44.673742+00:00"},"skill_score":0.8696,"benchmark_models":[{"model":"gemini-3.6-flash","headline":true,"delta_pts":39.13,"with_pass_pct":87,"without_pass_pct":47.8,"tokens_delta_pct":104.7,"turns_delta_pct":0,"total_cases":23,"cases_aggregated":23,"verdict":"mixed","never_hurt":true,"completed_at":"2026-08-30T19:15:44.673742+00:00","run_id":"73028310-a51d-4041-8146-3806af45c9f5","version_number":1,"is_latest_version":true,"gate":null}],"trust":{"skill_safety":"passed","safety_status":"clean","intent_verdict":"safe","content_status":"clean","indexable":true},"license":"MIT","install_count":0,"manifest_hash":"d13d1065acc990b7f3e97b5c9e811679a9cb511950d8b1cec7dac18a8b09da34","raw_url":"https://app.decimal.ai/s/jeremylongshore-langchain-eval-harness/SKILL.md","scorecard_url":"https://app.decimal.ai/skills/jeremylongshore-langchain-eval-harness"}