RL.VENDORS

Building the RL ecosystem

Find the companies
powering real-world RL.

A curated directory of companies building environments, data, evaluations, infrastructure, and related capabilities for reinforcement learning and agent systems.

All Market Segments
Focus Area
Domain
Service / Capability
Company Type
Sort by
AfterQuery logo
AfterQueryData & Post-training

Applied research lab building training data, evaluation datasets, and reinforcement-learning environments around expert professional workflows.

RL EnvironmentsEvaluationsHuman Data
AgileRL logo
AgileRLTraining Platforms

AgileRL provides enterprise RL training and RLOps for building, tuning, deploying, and continually improving specialized AI agents at scale.

RL EnvironmentsRLHF / Post-trainingAgent Infrastructure
Andon Labs logo
Andon LabsEvaluation & Safety

AI control and evaluation lab studying and deploying frontier agents through simulated benchmarks and real-world autonomous organizations.

Enterprise AgentsAgent InfrastructureEvaluations
Andromede logo
AndromedeEnvironments & Simulations

RL data lab programmatically generating environments, tasks, and verifiers from real-world data for post-training and evaluation.

RL EnvironmentsTraining DataRLHF / Post-training
Anthromind logo
AnthromindData & Post-training

Post-training and evaluation company combining subject-matter experts with data workflows for LLM evaluation, RLHF, supervised fine-tuning, and scalable oversight.

Training DataRLHF / Post-trainingEvaluations
Anyscale logo
AnyscaleRL Infrastructure

Ray-based distributed AI platform supporting large-scale LLM reinforcement learning, multi-turn agent RL, tool use, reward computation, and post-training.

RLHF / Post-trainingAgent InfrastructureSoftware Engineering
Appen logo
AppenData & Post-training

AI data provider offering end-to-end reinforcement-learning environment design, human data, evaluation, and verifier/reward construction for agentic AI.

RL EnvironmentsTraining DataRLHF / Post-training
Applied Compute logo
Applied ComputeTraining Platforms

Builds enterprise-specific intelligence using targeted reinforcement learning over integrated environments plus deployment infrastructure.

Enterprise AgentsRL EnvironmentsRLHF / Post-training
Arena logo
ArenaEvaluation & Safety

AI evaluation company, formerly LMArena, operating a human-judgment evaluation platform and commercial evaluation services for model labs and enterprises.

EvaluationsHuman DataEnterprise
ARIMLABS logo
ARIMLABSEnvironments & Simulations

Builds production-fidelity RLVR environments and long-horizon benchmarks in cyber, SRE, compilation, and STEM.

CodingRL EnvironmentsRLHF / Post-training
Artificial Analysis logo
Artificial AnalysisEvaluation & Safety

Independent AI benchmarking company measuring full agents and models with realistic agentic task suites and harnesses.

EvaluationsSoftware EngineeringComputer Use
Ashr logo
AshrTraining Platforms

Ashr provides enterprise post-training and continual learning for open-weight models using production feedback, fine-tuning, evaluation, and serving.

Enterprise AgentsRLHF / Post-trainingEvaluations
Aviro logo
AviroEnvironments & Simulations

Builds long-horizon RL environments and post-training datasets for coding, computer use, knowledge work, and research.

Computer UseCodingEnterprise Agents
BenchFlow logo
BenchFlowEvaluation & Safety

Open-source environment lab building stateful agent benchmarks and evaluation infrastructure.

RL EnvironmentsAgent InfrastructureEvaluations
Bespoke Labs logo
Bespoke LabsEnvironments & Simulations

Applied AI research lab building reinforcement-learning environments and infrastructure, evaluation, and data-curation tooling for AI agents.

CodingRL EnvironmentsTraining Data
Castform logo
CastformTraining Platforms

Castform provides managed RL post-training for open-weight models with data preparation, rewards, tools, GPU training, evaluation, and deployment.

Enterprise AgentsRL EnvironmentsRLHF / Post-training
Chakra Labs logo
Chakra LabsEnvironments & Simulations

Builds high-fidelity RL environments, evaluations, and human computer-use trajectory datasets for frontier AI research and post-training.

Computer UseRL EnvironmentsTraining Data
Collinear AI logo
Collinear AIEnvironments & Simulations

Builds realistic simulation labs, RL environments, verifiers, benchmarks, and training data for frontier agents.

RL EnvironmentsTraining DataRLHF / Post-training
CoreWeave logo
CoreWeaveRL Infrastructure

Provides specialized AI cloud infrastructure, including managed and serverless reinforcement-learning infrastructure for training AI agents.

RL EnvironmentsRLHF / Post-trainingAgent Infrastructure
Cua logo
CuaRL Infrastructure

Open-source infrastructure provider developing cross-operating-system desktop drivers, virtualized sandboxes, and computer-use benchmark suites.

Computer UseAgent InfrastructureEvaluations
Datacurve logo
DatacurveData & Post-training

Builds training and evaluation data, including reinforcement-learning environments and agent trajectories, for frontier model development.

CodingRL EnvironmentsTraining Data
Daytona logo
DaytonaRL Infrastructure

Provides isolated full-computer sandboxes for AI agents across containers, VMs, Windows, GPU, and macOS environments.

CodingAgent InfrastructureSoftware Engineering
Dissei logo
DisseiData & Post-training

Builds financial process data, graders, sealed evaluations, and long-horizon RL environments from real institutional-finance decisions.

RL EnvironmentsTraining DataRLHF / Post-training
Duality AI logo
Duality AIEnvironments & Simulations

Digital-twin simulation vendor whose Falcon platform supports synthetic data generation, robotics testing, autonomy validation, and reinforcement-learning workflows.

RL EnvironmentsTraining DataRobotics / Physical AI
E2B logo
E2BRL Infrastructure

Cloud sandbox infrastructure providing isolated, code-executable environments for AI agents.

Computer UseCodingRL Environments
EdotEnv logo
EdotEnvEnvironments & Simulations

Builds multi-step RL environments from financial market data for evaluation and post-training of research agents.

RL EnvironmentsRLHF / Post-trainingEvaluations
Emulated logo
EmulatedEnvironments & Simulations

Builds RL environments that simulate production engineering systems and software-lifecycle complexity.

CodingRL EnvironmentsTraining Data
Fleet AI logo
Fleet AIEnvironments & Simulations

Applied research lab building simulated environments and real-world scenarios for training and evaluating agents.

Computer UseRL EnvironmentsEvaluations
General Reasoning logo
General ReasoningEnvironments & Simulations

Research company building open reward and RL-environment infrastructure, including OpenReward.

RL EnvironmentsRLHF / Post-trainingAgent Infrastructure
Good Start Labs logo
Good Start LabsEnvironments & Simulations

Turns games into interactive learning environments with verifiable signals for training and evaluating frontier models.

RL EnvironmentsTraining DataEvaluations
Gray Swan AI logo
Gray Swan AIEvaluation & Safety

AI security company providing adversarial red-teaming and runtime protection for models and agents.

EvaluationsAI Safety / Red TeamingEnterprise
Halluminate logo
HalluminateEnvironments & Simulations

Builds computer- and tool-use RL environments, datasets, evaluations, and verifiers for economically valuable financial-services workflows.

Computer UseRL EnvironmentsTraining Data
Handshake AI logo
Handshake AIData & Post-training

Handshake's frontier-AI business spanning expert human data, evaluations, verifier research, and RL-environment work.

RL EnvironmentsTraining DataEvaluations
hiloop logo
hiloopRL Infrastructure

hiloop provides automated-research infrastructure with forkable compute, sandboxes, experiment lineage, observability, and training orchestration.

RLHF / Post-trainingAgent InfrastructureEvaluations
HUD logo
HUDEnvironments & Simulations

Platform for building, running, and evaluating reinforcement-learning environments and agent tasks.

Computer UseRL EnvironmentsAgent Infrastructure
Huzzle Labs logo
Huzzle LabsEnvironments & Simulations

Builds reinforcement-learning environments, computer-use models, and evaluation tooling for enterprise AI deployment.

Computer UseCodingEnterprise Agents
iMerit logo
iMeritData & Post-training

EXL-owned AI training and evaluation business providing expert-led model training, evaluation, RL-related data, and multimodal data services.

Training DataRLHF / Post-trainingRobotics / Physical AI
Incalmo logo
IncalmoEnvironments & Simulations

Builds high-fidelity, difficult, verifiable RL environments for autonomous cybersecurity capabilities.

RL EnvironmentsAI Safety / Red TeamingCybersecurity
Invisible Technologies logo
Invisible TechnologiesData & Post-training

Provides RL environments, expert data, annotation, and evaluation infrastructure for model builders and enterprises across multiple professional verticals.

RL EnvironmentsTraining DataRLHF / Post-training
Labelbox logo
LabelboxData & Post-training

Provides reinforcement-learning data, environments, evaluations, and expert-feedback infrastructure for frontier AI teams.

CodingRL EnvironmentsTraining Data
Mechanize logo
MechanizeEnvironments & Simulations

Software company building reinforcement learning environments and software engineering evaluations for frontier coding agents.

CodingRL EnvironmentsEvaluations
Mercor logo
MercorData & Post-training

Expert marketplace providing human datasets, benchmarks, and reinforcement-learning environments for professional-workflow AI training.

RL EnvironmentsRLHF / Post-trainingEvaluations
Metaphi AI logo
Metaphi AIEnvironments & Simulations

Builds RL environments, agent evaluations, datasets, and long-horizon enterprise benchmarks.

CodingRL EnvironmentsTraining Data
micro1 logo
micro1Data & Post-training

Data lab combining expert human data, Realm RL environments, contextual agent evaluations, and robotics data.

RL EnvironmentsTraining DataRobotics / Physical AI
Modal logo
ModalRL Infrastructure

Provides high-concurrency sandboxes for AI code execution and RL rollouts, including coding-agent training environments.

CodingRLHF / Post-trainingAgent Infrastructure
Morph Labs logo
Morph LabsRL Infrastructure

Cloud infrastructure company providing programmable persistent VM devboxes and branching environments for coding agents, computer-use agents, development, and testing.

Computer UseCodingAgent Infrastructure
NO
Northstar RL LabsEnvironments & Simulations

Managed reinforcement-learning evaluation environments for testing tool-using agents across reproducible task suites.

Ooak Data logo
Ooak DataEnvironments & Simulations

Turns real enterprise data into anonymized digital twins and expert-level RL environments for agents.

Enterprise AgentsRL EnvironmentsTraining Data
Osmosis logo
OsmosisTraining Platforms

Forward-deployed reinforcement-learning platform for task-specific agent/model post-training with custom tools, reward functions, rollouts, and retraining loops.

RLHF / Post-trainingAgent InfrastructureSoftware Engineering
Oumi logo
OumiTraining Platforms

Open-source and hosted platform for building, evaluating, post-training, deploying, and continuously improving specialized AI models.

Training DataRLHF / Post-trainingSoftware Engineering
Patronus AI logo
Patronus AIEnvironments & Simulations

Builds simulation and evaluation infrastructure for training and testing AI agents, including Digital World Models, generative RL environments, benchmarks, and agentic supervision tools.

RL EnvironmentsTraining DataRLHF / Post-training
pre.dev logo
pre.devEnvironments & Simulations

Builds long-horizon coding RL environments from licensed private production repositories for frontier-model post-training.

CodingRL EnvironmentsTraining Data
Preference Model logo
Preference ModelEnvironments & Simulations

AI research-engineering company building high-quality RL training environments and reward functions for real-world machine-learning research tasks.

RL EnvironmentsRLHF / Post-trainingEvaluations
Prime Intellect logo
Prime IntellectRL Infrastructure

Open infrastructure stack for reinforcement-learning environments, hosted training, evaluation, and compute.

RL EnvironmentsAgent InfrastructureEvaluations
Prolific logo
ProlificData & Post-training

Human-data and evaluation platform providing verified participants and domain experts for AI training, alignment, safety testing, and model evaluation.

Training DataRLHF / Post-trainingEvaluations
ReasonCore AI logo
ReasonCore AIData & Post-training

Expert-data and evaluation company turning proprietary domain data into verified RL training sets, sandboxed environments, and adaptive evaluations.

RL EnvironmentsTraining DataRLHF / Post-training
Refresh logo
RefreshEnvironments & Simulations

Builds RL environments, evaluations, and verifiable training data for coding and computer-use agents, including software-world simulations, Terminal-Bench-style tasks, and long-horizon tool gyms.

Computer UseCodingRL Environments
Rise Data Labs logo
Rise Data LabsData & Post-training

Provides expert human data, RLHF, evaluations, agent training trajectories, and custom RL environments for frontier and domain-specific AI systems.

RL EnvironmentsTraining DataRLHF / Post-training
RO
Robotic DataData & Post-training

Physical-AI data infrastructure company, formerly Voxelmaps, providing world and human datasets for autonomous vehicles, humanoid robots, drones, and intelligent machines.

Training DataRobotics / Physical AIHuman Data
Runloop logo
RunloopRL Infrastructure

Provides VM-based Devbox sandboxes where AI agents can safely execute code, use files, APIs, and browsers.

Computer UseCodingAgent Infrastructure
Sama logo
SamaData & Post-training

AI data company providing human-in-the-loop training data, model evaluation, annotation, and preference/alignment workflows for advanced AI systems.

Training DataRLHF / Post-trainingEvaluations
Scale AI logo
Scale AIData & Post-training

Data infrastructure company offering training data, evaluation platforms, and reinforcement learning environments for AI model development.

RL EnvironmentsRLHF / Post-trainingEvaluations
Snorkel AI logo
Snorkel AIData & Post-training

Develops data, environments, and evaluation infrastructure, including expert-data workflows, for specialized and agentic AI systems.

RL EnvironmentsTraining DataRLHF / Post-training
SuperAnnotate logo
SuperAnnotateData & Post-training

Human-data and RL-environment company providing expert data, environment tooling, trajectories, verifiers, evaluations, and post-training workflows for frontier AI teams.

Computer UseRL EnvironmentsTraining Data
Surge AI logo
Surge AIData & Post-training

Human-data and evaluation provider offering expert data, RLHF, and reinforcement-learning environments for frontier AI systems.

RL EnvironmentsRLHF / Post-trainingEvaluations
Thinking Machines Lab / Tinker logo
Thinking Machines Lab / TinkerTraining Platforms

Model-training API and cookbook with composable RL environments, GRPO pipelines, tool-use training, and multi-agent RL recipes.

RLHF / Post-trainingAgent InfrastructureSoftware Engineering
Toloka logo
TolokaData & Post-training

AI data company building RL gyms, virtual environments, trajectories, human-feedback data, evaluations, and safety datasets for AI agents.

Computer UseRL EnvironmentsTraining Data
TrainLoop logo
TrainLoopTraining Platforms

TrainLoop trains reasoning models and agents for long-horizon enterprise tasks using reinforcement learning, evaluation, and continual learning.

Enterprise AgentsRLHF / Post-trainingEvaluations
Turing logo
TuringData & Post-training

Provides datasets, reinforcement-learning environments, expert contributors, and benchmarks for frontier AI model training and evaluation.

CodingRL EnvironmentsRLHF / Post-training
Ulam logo
UlamData & Post-training

Provides reasoning datasets, benchmarks, and verifier-backed RL gyms for mathematics, algorithms, science, and code.

RL EnvironmentsTraining DataRLHF / Post-training
Vals AI logo
Vals AIEvaluation & Safety

Independent evaluation platform building real-world, domain-specific benchmarks for AI models and agents.

EvaluationsSoftware EngineeringFinance
Veris AI logo
Veris AIEnvironments & Simulations

Simulation infrastructure that recreates production users, systems, APIs, and data for agent evaluation, benchmarking, RL, and SFT.

RL EnvironmentsRLHF / Post-trainingAgent Infrastructure
Vmax logo
VmaxEnvironments & Simulations

Reinforcement-learning company building self-play task generation and environment infrastructure that turns proprietary data and evaluations into new training environments.

RL EnvironmentsRLHF / Post-trainingEvaluations
ZE
Zero Proof LabsTraining Platforms

Zero Proof Labs provides agent simulations, evaluation, training data, and hosted SFT, GRPO, DPO, and reward-model post-training workflows.

RL EnvironmentsTraining DataRLHF / Post-training
Browse by market segment:Environments & SimulationsData & Post-trainingRL InfrastructureEvaluation & SafetyTraining Platforms

Our approach

Public sources. Unknowns stay unknown.

We use a consistent, source-driven research process, keep unverifiable information explicit, and do not use rankings or pay-to-rank placement.