FHIRBench: Benchmark Data and Evaluation Results
收藏官方服务:
资源简介:
Raw evaluation data for FHIRBench: Benchmarking FHIR Clinical Data Serialization Strategies for Large Language Models. Contains Layer 1 (token-level F1) scored responses for 4 models x 1800 evaluations each, Layer 2 (LLM-as-judge) scores for 7187 evaluations, patient-level statistical tests, and the canonical prompt sets used for evaluation.
提供机构:
Zenodo创建时间:
2026-07-06



