Ai 自動化
LLM-Wiki 是什麼?從 Retrieval-as-Reasoning 看它與 RAG 的差異、限制與選型
解析 LLM-Wiki 的知識編譯與 agent-native retrieval 原理,對照 RAG 的適用情境、治理風險與 hybrid 落地方式。
閱讀全文
RTX 4090 本地部署:Gemma 4 與 Qwen 3.6 的效能測試
以 RTX 4090 24GB VRAM 為基準,拆解 Gemma 4 與 Qwen 3.6 的量化選型、KV Cache、Flash Attention、Docker llama.cpp 部署與 OOM 排障方法。
閱讀全文