Inference Providers
Active filters: ppo, trl
MattBou00/llama-3-2-1b-detox_v1f_SCALE8_round4-checkpoint-epoch-80
Reinforcement Learning
• 1B • Updated • 7
MattBou00/llama-3-2-1b-detox_v1f_SCALE8_round4-checkpoint-epoch-100
Reinforcement Learning
• 1B • Updated • 7
MattBou00/llama-3-2-1b-detox_v1f_SCALE8_round4
Reinforcement Learning
• 1B • Updated • 7
MattBou00/llama-3-2-1b-detox_v1f_SCALE8_round1-checkpoint-epoch-20
Reinforcement Learning
• 1B • Updated • 9
MattBou00/llama-3-2-1b-detox_v1f_SCALE8_round1-checkpoint-epoch-40
Reinforcement Learning
• 1B • Updated • 8
MattBou00/llama-3-2-1b-detox_v1f_SCALE8_round1-checkpoint-epoch-60
Reinforcement Learning
• 1B • Updated • 7
MattBou00/llama-3-2-1b-detox_v1f_SCALE8_round1-checkpoint-epoch-80
Reinforcement Learning
• 1B • Updated • 10
MattBou00/llama-3-2-1b-detox_v1f_SCALE8_round1-checkpoint-epoch-100
Reinforcement Learning
• 1B • Updated • 12
MattBou00/llama-3-2-1b-detox_v1f_SCALE8_round1
Reinforcement Learning
• 1B • Updated • 7
MattBou00/llama-3-2-1b-detox_v1f_SCALE8_round5-checkpoint-epoch-20
Reinforcement Learning
• 1B • Updated • 8
MattBou00/llama-3-2-1b-detox_v1f_SCALE8_round5-checkpoint-epoch-40
Reinforcement Learning
• 1B • Updated • 11
MattBou00/llama-3-2-1b-detox_v1f_SCALE8_round5-checkpoint-epoch-60
Reinforcement Learning
• 1B • Updated • 11
MattBou00/llama-3-2-1b-detox_v1f_SCALE8_round5-checkpoint-epoch-80
Reinforcement Learning
• 1B • Updated • 7
MattBou00/llama-3-2-1b-detox_v1f_SCALE8_round5-checkpoint-epoch-100
Reinforcement Learning
• 1B • Updated • 7
MattBou00/llama-3-2-1b-detox_v1f_SCALE8_round5
Reinforcement Learning
• 1B • Updated • 7
MattBou00/llama-3-2-1b-detox_v1f_SCALE8_round3-checkpoint-epoch-20
Reinforcement Learning
• 1B • Updated • 6
MattBou00/llama-3-2-1b-detox_v1f_SCALE8_round3-checkpoint-epoch-40
Reinforcement Learning
• 1B • Updated • 7
MattBou00/llama-3-2-1b-detox_v1f_SCALE8_round3-checkpoint-epoch-60
Reinforcement Learning
• 1B • Updated • 7
MattBou00/llama-3-2-1b-detox_v1f_SCALE8_round3-checkpoint-epoch-80
Reinforcement Learning
• 1B • Updated • 7
MattBou00/llama-3-2-1b-detox_v1f_SCALE8_round3-checkpoint-epoch-100
Reinforcement Learning
• 1B • Updated • 13
MattBou00/llama-3-2-1b-detox_v1f_SCALE8_round3
Reinforcement Learning
• 1B • Updated • 6
MMattaparthy/ppo_model_final
Text Generation
• 2B • Updated • 16
sodeniZz/llm-course-hw2-ppo
Text Generation
• 0.1B • Updated • 11
slavin-lisa/trainer_output
Text Generation
• 0.1B • Updated • 14
Amir337/ppo-smollm2-135m-humanllm
Text Generation
• 0.1B • Updated • 13
ianyang02/ppo_model_qwen3-4b_aita_h200
Updated
MattBou00/SingleRound1B-checkpoint-epoch-20
Reinforcement Learning
• 1B • Updated • 7
MattBou00/SingleRound1B-checkpoint-epoch-40
Reinforcement Learning
• 1B • Updated • 8
MattBou00/SingleRound1B-checkpoint-epoch-60
Reinforcement Learning
• 1B • Updated • 5
MattBou00/ROUND5RETRYRUNNINGCODE-checkpoint-epoch-20
Reinforcement Learning
• 1B • Updated • 7