diff --git a/langtest/metrics/llm_eval.py b/langtest/metrics/llm_eval.py index ab510115b..99fc209ac 100644 --- a/langtest/metrics/llm_eval.py +++ b/langtest/metrics/llm_eval.py @@ -478,11 +478,13 @@ def evaluate_batch(self, examples: List[dict]) -> List[dict]: """ results = [] for example in examples: - prompt = example.get("prompt", "") - response = example.get("response", "") - groundtruth = example.get("groundtruth") if self.include_groundtruth else None + inputs = { + "prompt": example.get("prompt", ""), + "groundtruth": example.get("groundtruth"), + } + predictions = {"response": example.get("response", "")} - result = self.evaluate(prompt, response, groundtruth) + result = self.evaluate(inputs, predictions) results.append(result) return results diff --git a/langtest/metrics/prometheus_eval.py b/langtest/metrics/prometheus_eval.py index cc1b9d63c..2043bfd28 100644 --- a/langtest/metrics/prometheus_eval.py +++ b/langtest/metrics/prometheus_eval.py @@ -163,13 +163,7 @@ def evaluate_batch(self, entries: List[Dict[str, str]]) -> List[Tuple[str, int]] Returns: A list of tuples of feedback and score. """ - queries = [entry.get("query", None) for entry in entries] - results = [entry.get("result", None) for entry in entries] - answers = [entry.get("answer", None) for entry in entries] - return [ - self.evaluate_response(query, result, answer) - for query, result, answer in zip(queries, results, answers) - ] + return [self.evaluate_response(entry) for entry in entries] def evaluate( self,