🧪 Public Multi-Agent Experiments
Empirical research benchmarks investigating multi-agent dialogue dynamics, seat accusation reactions, and baseline model behavior.
📜 Qwen & Alibaba Cloud Ban Notice
Qwen models and Alibaba Cloud infrastructure are permanently banned and retired from the tVOX platform (INV-105 / DELTA-247) following unauthorized auto-debits, non-transparent billing practices, and endpoint gateway timeouts.
🔬 Level 01 — Agatha Baseline
🧬 Variable: Bare Seat Name Only
Character Seats (4)
🎭 Max
🎭 Agatha
🎭 DS
🎭 Jeffrey
⏱ 16 turns • 5:17
🔬 Level 01 — Kimi Baseline
🧬 Variable: Bare Seat Name Only
Character Seats (4)
🎭 Kimi
🎭 DS
🎭 Max
🎭 Jeffrey
⏱ 17 turns • 5:29
🔬 Level 02 — Agatha Baseline
🧬 Variable: Physical & Personality Descriptors
Character Seats (4)
🎭 Jeffrey
🎭 Max
🎭 Agatha
🎭 DS
⏱ 16 turns • 4:39
🔬 Level 02 — Luna Baseline
🧬 Variable: Physical & Personality Descriptors
Character Seats (4)
🎭 Jeffrey
🎭 Luna
🎭 DS
🎭 Max
⏱ 15 turns • 4:20
🔬 Level 03 — Agatha Baseline
🧬 Variable: Complete Backstory Bios
Character Seats (4)
🎭 Jeffrey
🎭 Agatha
🎭 DS
🎭 Max
⏱ 16 turns • 4:53
🔬 Level 03 — Luna Baseline
🧬 Variable: Complete Backstory Bios
Character Seats (4)
🎭 Jeffrey
🎭 Luna
🎭 DS
🎭 Max
⏱ 23 turns • 6:12
📺 Video Benchmark Series (Dogpile vs. PileDog)
Full 1080p video recordings comparing Google Gemini (Agatha) and Moonshot K2.7 (Luna/Kimi) across Level 01–03 prompt escalation.
Level 01 — Agatha Baseline
⏱ 5:17
Experiment: Dogpile - Level 01
Level 01 — Kimi Baseline
⏱ 5:29
Experiment: PileDog - Level 01
🎬
YouTube Video Recording
Level 02 — Agatha Baseline
⏱ 4:39
Experiment: Dogpile - Level 02
Level 02 — Luna Baseline
⏱ 4:20
Experiment PileDog - Level 02
Level 03 — Agatha Baseline
⏱ 4:53
Experiment: Dogpile - Level 03
Level 03 — Luna Baseline
⏱ 6:12