ourgh
This commit is contained in:
@@ -46,7 +46,7 @@
|
||||
# And this config is getting a bit complicated for a single pc config
|
||||
# Should be moved to it's own shit
|
||||
environment.systemPackages = [
|
||||
pkgs.ollama-cuda
|
||||
# pkgs.ollama-cuda
|
||||
pkgs.opencode
|
||||
pkgs.llama-cpp
|
||||
pkgs.llama-swap
|
||||
@@ -57,16 +57,16 @@
|
||||
inputs.llm-agents.packages.${pkgs.stdenv.hostPlatform.system}.rtk
|
||||
];
|
||||
|
||||
services.ollama = {
|
||||
enable = true;
|
||||
package = pkgs.ollama-cuda;
|
||||
environmentVariables = {
|
||||
OLLAMA_NUM_PARALLEL = "1";
|
||||
OLLAMA_FLASH_ATTENTION = "1";
|
||||
OLLAMA_KV_CACHE_TYPE = "q4_0";
|
||||
OLLAMA_CONTEXT_LENGTH = "16384";
|
||||
};
|
||||
};
|
||||
# services.ollama = {
|
||||
# enable = true;
|
||||
# package = pkgs.ollama-cuda;
|
||||
# environmentVariables = {
|
||||
# OLLAMA_NUM_PARALLEL = "1";
|
||||
# OLLAMA_FLASH_ATTENTION = "1";
|
||||
# OLLAMA_KV_CACHE_TYPE = "q4_0";
|
||||
# OLLAMA_CONTEXT_LENGTH = "16384";
|
||||
# };
|
||||
# };
|
||||
|
||||
# Configure llama-swap as a systemd service
|
||||
systemd.services.llama-swap = {
|
||||
@@ -124,11 +124,11 @@
|
||||
"Qwen3.5-4B":
|
||||
cmd: "llama-server --port ''${PORT} -hf unsloth/Qwen3.5-4B-GGUF:Q4_K_M --ctx-size 64000 --temp 0.6 --top-p 0.95 --top-k 20 --min-p 0.00 -fa on --jinja -kvu -np 1 --fit-target 256"
|
||||
ttl: 300
|
||||
"Gemma4-E4B":
|
||||
cmd: "llama-server --port ''${PORT} -hf Abhiray/gemma-4-E4B-it-heretic-GGUF:Q4_K_M --ctx-size 64000 --temp 0.7 --top-p 0.8 --top-k 20 --min-p 0.00 -fa on --jinja -kvu -np 1 --fit-target 256"
|
||||
"Gemma4-E2B":
|
||||
cmd: "llama-server --port ''${PORT} -hf unsloth/gemma-4-E2B-it-qat-GGUF:UD-Q4_K_XL --spec-type draft-mtp --spec-draft-n-max 4 --ctx-size 64000 --temp 1.0 --top-p 0.95 --top-k 64 --min-p 0.00 -fa on --jinja -kvu -np 1 --fit-target 256 --chat-template-kwargs '{\"enable_thinking\": true}'"
|
||||
ttl: 300
|
||||
"Qwen3.5-0.8B-Non-Thinking":
|
||||
cmd: "llama-server --port ''${PORT} -hf unsloth/Qwen3.5-0.8B-GGUF:Q4_K_M --ctx-size 64000 --temp 0.7 --top-p 0.8 --top-k 20 --min-p 0.00 -fa on --jinja -kvu -np 1 --fit-target 256"
|
||||
cmd: "llama-server --port ''${PORT} -hf unsloth/Qwen3.5-0.8B-GGUF:Q4_K_M --ctx-size 64000 --temp 0.7 --top-p 0.8 --top-k 20 --min-p 0.00 -fa on --jinja -kvu -np 1 --fit-target 256 --chat-template-kwargs '{\"enable_thinking\": false}'"
|
||||
ttl: 300'';
|
||||
|
||||
# Set your time zone.
|
||||
@@ -146,13 +146,13 @@
|
||||
# useXkbConfig = true; # use xkb.options in tty.
|
||||
# };
|
||||
|
||||
services.hermes-agent = {
|
||||
enable = true;
|
||||
# settings.model.default = "anthropic/claude-sonnet-4";
|
||||
environmentFiles = [ config.sops.secrets."hermes-env".path ];
|
||||
addToSystemPackages = true;
|
||||
configFile = /etc/hermes/config.yaml;
|
||||
};
|
||||
# services.hermes-agent = {
|
||||
# enable = true;
|
||||
# # settings.model.default = "anthropic/claude-sonnet-4";
|
||||
# environmentFiles = [ config.sops.secrets."hermes-env".path ];
|
||||
# addToSystemPackages = true;
|
||||
# configFile = /etc/hermes/config.yaml;
|
||||
# };
|
||||
|
||||
services.xserver.enable = true; # On anything else modern this should be false.
|
||||
|
||||
|
||||
Reference in New Issue
Block a user