Eszközök

llm-chat-completions-server 0.1a0: helyi LLM-ek Chat Completions kompatibilis kiszolgálója

A közlemény főszereplője a llm-chat-completions-server nevű projekt, amelynek 0.1a0 verziója lehetővé teszi a helyi LLM modellek OpenAI Chat Completions stílusú hívásokkal való kiszolgálását.

llm-chat-completions-server 0.1a0: helyi LLM-ek Chat Completions kompatibilis kiszolgálója

Megjelent az llm-chat-completions-server 0.1a0, amely helyi HTTP-végpontot biztosít, ami kompatibilis az OpenAI Chat Completions API formátumával. A kiszolgáló az llm környezetbe telepített modelleket teszi elérhetővé úgy, hogy a kliensről érkező üzenetsorozatokat ChatGPT-stílusú /v1/chat/completions végpontként szolgálja ki.

Miért fontos ez?

A LLM 0.32rc1 verziójában bevezetett tartalom-alapú (content-addressable) naplók egyik célja az volt, hogy támogassák az OpenAI Chat Completion stílusú kéréseket, ahol minden új beérkező üzenet kiterjeszti az előző beszélgetést. Ilyen kérések esetén a kliens általában egyre hosszabb üzenetsorozatokat küld (például: felhasználó kérdése, asszisztens válasza, újabb felhasználói kérdés). A LLM új sémája úgy lett tervezve, hogy ezeket a növekvő beszélgetésállapotokat deduplikálja az egyes üzenetrészek hash-értékeinek használatával.

Hogyan próbálható ki?

A kiadáshoz készült egy kiegészítő (plugin), amely gyorsan telepíthető és elindítható a következő parancsokkal:

  • uv tool install llm --pre
  • llm install llm-chat-completions-server
  • llm chat-completions-server -p 9001

Az utolsó parancs elindít egy localhost szervert a 9001-es porton, amely a telepített llm pluginok által biztosított összes LLM-modellt egy ChatGPT Completions kompatibilis végponton teszi elérhetővé.

API-viselkedés

A bemutatott példa egy tipikus OpenAI Chat Completions típusú kérés formáját mutatja:

curl http://localhost:8002/v1/chat/completions
-H 'Content-Type: application/json'
-d '{ "model": "qwen3.5-4b", "messages": [ {"role": "user", "content": "Capital of France?"}, {"role": "assistant", "content": "Paris."}, {"role": "user", "content": "Germany?"} ] }'

A beszélgetés állapotát a kliens tartja nyilván, így minden új kérés jellemzően hosszabb lesz; az llm új séma ezeket a redundanciákat hash-ekkel kezeli.

Megjegyzés

A bejegyzés megemlíti, hogy „GPT-5.6 Sol wrote the whole thing” — azaz a dokumentáció szerint GPT-5.6 Sol generálta a leírást, és jól ismeri az OpenAI Chat Completions API alakját.

Összefoglalva: az llm-chat-completions-server 0.1a0 egyszerű módszert kínál arra, hogy helyi környezetben Chat Completions-kompatibilis API-n keresztül érjük el az llm-telepített nyelvi modelleket, miközben az LLM 0.32rc1 tartalom-alapú naplózási megoldása csökkenti a beszélgetési állapotok ismétlődését.