RL.VENDORS
Collinear AI logo

Collinear AI


About

Builds realistic simulation labs, RL environments, verifiers, benchmarks, and training data for frontier agents.

What They Offer

Commercial or operational services this company provides.

Agent evaluations
Rubrics / verifiers
Open-source tooling
Custom RL environments
Training datasets
Agent trajectories

Products & Public Artifacts

Simulation Lab
Environment · Commercial

Self-serve staging platform providing isolated, deterministic playgrounds populated with realistic simulated enterprise applications and tools for testing agents before production.

Visit artifact →
CWE-Bench
Benchmark · Public

Evaluates coding agents against real vulnerabilities in production codebases, covering 100 held-out tasks across 54 CWEs and all 10 OWASP categories.

Visit artifact →
SimLab
Tool · Open source

Open-source self-serve CLI and SDK for building sandboxed, stateful RL environments that simulate enterprise users, tools, and multi-step workflows.

Visit artifact →
YC-Bench
Benchmark · Open source

Open-source benchmark simulating one year of a startup to test whether agents maintain strategic coherence across hundreds of turns.

Visit artifact →

Technical Capabilities

Code / Terminal ExecutionComputer UseLong-Horizon TasksProgrammatic VerifiersReal-App / Workplace SimulationSandboxed ExecutionStateful / Persistent EnvironmentsTool / API / MCP Use

Only publicly documented capabilities are shown. Absence does not imply the capability is unavailable.

Focus Areas

RL EnvironmentsTraining DataRLHF / Post-trainingEvaluations

Domains

Software EngineeringComputer UseEnterpriseFinanceCybersecurity

Leadership

Nazneen Rajani
Co-founder & CEO

Led post-training research at Hugging Face and Salesforce Research before founding Collinear AI; work spans model evaluation, safety, alignment, and post-training.

Soumyadeep Bakshi
Co-Founder

Led Deloitte's AI practice advising frontier labs on data for model development before co-founding Collinear AI; work spans data strategy, verification, and evaluation infrastructure.