Skip to content
@composo-ai

composo-ai

Popular repositories Loading

  1. llm-judge-criteria-ensembling llm-judge-criteria-ensembling Public

    An Empirical Investigation of Practical LLM-as-a-Judge Improvement Techniques on RewardBench 2

    TeX 11

  2. PRIME PRIME Public

    PrimeBench: an open benchmark for evaluating evaluators. 400 paired responses across finance, news, biomedical and technical support, edited along conflicting criteria to test whether a reward mode…

    Python 4

  3. omission-bench omission-bench Public

    OmissionBench harness: code behind the two companion papers on omission blindness in LLM judges of AI clinical notes (data on Hugging Face: ComposoAI/OmissionBench)

    Python 3

  4. judge-uncertainty-decomposition judge-uncertainty-decomposition Public

    Code and data for "Decomposing LLM-Judge Uncertainty to Target Expert Labels" (arXiv:2609.06444)

    Python 1

Repositories

Showing 4 of 4 repositories

People

This organization has no public members. You must be a member to see who’s a part of this organization.

Top languages

Loading…

Most used topics

Loading…