Home Knowledge Base Human Evaluation for LLMs

Human Evaluation for LLMs

Why Human Evaluation? Automated metrics miss nuances that humans catch: creativity, helpfulness, safety, and overall quality.

Evaluation Types

TypeWhat it Measures
Absolute ratingRate response 1-5
Pairwise comparisonA vs B, which is better?
RankingOrder N responses
Task completionDid it accomplish goal?
Aspect-basedRate helpfulness, accuracy, etc.

Annotation Platforms

PlatformTypeCost
Amazon MTurkCrowdsourceLow
Scale AIManagedHigh
Surge AIQuality focusMedium
ProlificAcademicMedium
In-houseExpertVariable

MTurk Setup

import boto3

mturk = boto3.client("mturk",
    region_name="us-east-1",
    endpoint_url="https://mturk-requester.us-east-1.amazonaws.com"
)

# Create HIT
response = mturk.create_hit(
    Title="Evaluate AI Response",
    Description="Rate the quality of AI responses",
    Keywords="AI, evaluation, rating",
    Reward="0.10",
    MaxAssignments=5,
    LifetimeInSeconds=86400,
    Question=open("eval_template.xml").read()
)

Evaluation Template

<QuestionForm>
  <Question>
    <QuestionContent>
      <Text>Rate this AI response:</Text>
      <Text>[Response here]</Text>
    </QuestionContent>
    <AnswerSpecification>
      <SelectionAnswer>
        <StyleSuggestion>radiobutton</StyleSuggestion>
        <Selections>
          <Selection><SelectionIdentifier>1</SelectionIdentifier>
            <Text>Very Poor</Text></Selection>
          <Selection><SelectionIdentifier>5</SelectionIdentifier>
            <Text>Excellent</Text></Selection>
        </Selections>
      </SelectionAnswer>
    </AnswerSpecification>
  </Question>
</QuestionForm>

Inter-Annotator Agreement

from sklearn.metrics import cohen_kappa_score

# Measure agreement between annotators
kappa = cohen_kappa_score(annotator1_ratings, annotator2_ratings)
# kappa > 0.8: strong agreement
# kappa 0.6-0.8: substantial
# kappa 0.4-0.6: moderate

Quality Control

MethodPurpose
Gold questionsCatch low-effort workers
RedundancyMultiple annotators per item
Qualification testsFilter workers
Time limitsPrevent rushing

Best Practices

human evalannotationmturk

Explore 500+ Semiconductor & AI Topics

From EUV lithography to CUDA optimization — search the full knowledge base or chat with our AI assistant.