← Исследование на главной

Исследование / Контроль владельца

LLMOS

R&D персональных AI-систем.

Гипотеза исследуется

Исследую, как хранить актуальный контекст и сохранять контроль владельца над решениями AI. Первые эксперименты дали сигнал, последующие — сузили исходную гипотезу.

ПроблемаИстория AI-диалога смешивает идеи, старые планы и действующие решения

Первый пользовательЯ сам; внешних клиентов и PMF нет

Результат этапаПроверка и пересмотр гипотезы, инженерный R&D

Лично я

Гипотеза Managed Current State, критерии экспериментов, архитектурные границы, оценка валидности и решения о следующем этапе.

Работа AI

Критика гипотез, экспериментальный протокол, код benchmark, автоматизация прогонов и анализ ограничений.

Другие специалисты

Другой человеческой команды нет. Использование OpenAI-инструментов не означает партнёрства с OpenAI.

AI-инструментыChatGPT · Codex · coding agents. DeepSeek — модель автоматизированного benchmark; Hermes — внешний агентный runtime.

Главный результат

Данные изменили
первоначальное решение.

Первые ручные прогоны оказались методологически ненадёжными и были исключены из доказательств. Я перевёл эксперимент на автоматизированный stateless benchmark.

Положительный smoke-сигнал 12/15 оценок не стал подтверждением. Более строгие проверки сократили преимущество, а объективные и стрессовые проверки не выявили отличий от сравниваемого подхода.

Широкая гипотеза не подтвердилась. Следующий фокус — актуальность и стоимость контекста, происхождение данных и полномочия владельца.

Демонстрационный интерфейс LLMOS: предложение AI и отдельно подтверждённые решения
Мои решения

Предложение AI и подтверждённое состояние представлены отдельно. Право принять изменение остаётся у владельца.

Принцип исследования

Идея, решение и действие — отдельные шаги.

  1. 01 / Контекст

    «Думаю провести интервью»

    Мысль сохраняется без изменения плана.

  2. 02 / Решение

    «На этой неделе — три интервью»

    Владелец явно подтверждает новый приоритет.

  3. 03 / Полномочия

    «Напомни один раз»

    Разрешение ограничивает действие, срок и число выполнений.

Материалы инженерного этапа

Реальные интерфейсы · локальный стенд · демонстрационные данные

Граница результата

Исследование
продолжается.

Node.js, PostgreSQL, MCP, Docker Compose и Caddy — техническая основа Platform. Hermes — внешний runtime для агентных экспериментов.

LLMOS не представлен как готовая коммерческая платформа. У проекта нет внешних клиентов и доказанного универсального преимущества Managed Current State.

Подробнее: как устроен проект, мой вклад и дальнейшие шаги

Проблема и гипотеза

При работе над долгими проектами с AI приходится повторять актуальные вводные и отделять действующие решения от старых предложений. Модель может воспринимать обсуждение как решение или переносить устаревший план в новое действие.

Гипотеза Managed Current State: явно управляемое актуальное состояние поможет сохранять контекст и контроль владельца. Предложение AI, подтверждённое решение, изменение состояния и разрешение на внешнее действие должны оставаться разными сущностями.

Что я проверял

Я сформулировал критерии и с помощью AI построил экспериментальный стенд M0. Первые ручные прогоны дали интересный результат, но обнаружились contamination и методологические дефекты. Я исключил их из доказательств и перешёл к автоматизированному stateless benchmark.

Положительный smoke-сигнал 12/15 оценок не стал основанием считать гипотезу подтверждённой. Он относился к небольшому набору сценариев. В последующих, более строгих проверках преимущество уменьшилось, а объективные и стрессовые проверки не показали отличий от сравниваемого подхода.

Более дорогой контекст также оказался ограничением. Использование одного provider для генерации и оценки — ещё одна методологическая граница этих экспериментов.

Что изменилось после результатов

Широкая гипотеза об универсальном преимуществе Managed Current State не подтвердилась. Я сузил направление исследования: экономия и обновление контекста, происхождение данных, полномочия владельца и границы действий AI.

Главный результат этапа — способ измерить гипотезу и изменить продуктовое решение на основании данных.

Кто что делал

Проект веду самостоятельно. Я определял проблему, гипотезу, критерии экспериментов, продуктовые и архитектурные границы. Сам решал, какие результаты валидны, достаточен ли сигнал и что строить дальше.

AI помогал исследовать альтернативы, критиковать гипотезы, разрабатывать протокол, реализовывать и рефакторить benchmark, автоматизировать прогоны и искать дефекты методики. Финальная интерпретация оставалась за мной; другой человеческой команды не было.

ChatGPT — discovery, критика, экспериментальный дизайн и интерпретация. Codex и coding agents — код и проверки. DeepSeek — модель автоматизированного benchmark. Hermes — внешний агентный runtime для экспериментов с Chief, Radar и интеграцией механизмов LLMOS.

Использование ChatGPT и Codex не означает партнёрства или совместной разработки с компанией OpenAI.

Инженерный этап и материалы

Platform 0.12.0 — инженерный R&D-этап. Его интерфейс показывает отдельные области памяти, решений, разрешений, агентов и данных. Для портфолио экраны восстановлены из исходного кода на локальном стенде с демонстрационными данными.

Техническая основа этого этапа: Node.js, PostgreSQL, MCP, Docker Compose и Caddy. Hermes используется как внешний runtime, не как собственная технология LLMOS.

Скриншоты подтверждают состояние интерфейса. Они не доказывают эффективность гипотезы или готовность платформы к коммерческой эксплуатации.

Текущая граница результата

LLMOS остаётся проверкой гипотезы и исследованием. У проекта нет внешних клиентов, PMF или доказанного универсального преимущества.

Проблема → гипотеза → эксперимент → первый сигнал → строгая проверка → частичное опровержение → изменение направления.

Следующий проект

LLM Production
Посмотреть проект ↗