Sebagai pengasas AINNA, saya sering berbual dengan pemilik SME di seluruh 马来西亚. Satu soalan yang sering timbul: "Adakah AI ini akan memakan kos besar?" Jawapannya bergantung. Bergantung kepada model, reka bentuk sistem, dan corak penggunaan, kos operasi AI boleh mencapai ratusan ribu USD sebulan. Tetapi isunya bukan semestinya AI itu mahal. Lebih kerap, masalahnya ialah syarikat menggunakan LLM besar untuk setiap tugas-termasuk kerja-kerja yang sebenarnya boleh diselesaikan dengan peraturan mudah, skrip, pangkalan data, atau model kecil di peringkat tempatan.
Ia umpama menghantar satu beg kecil dari 马六甲 ke Kuala Lumpur menggunakan lori kontena. Lori itu memang boleh buat kerja, tetapi Kancil pun boleh menghantar barang yang sama dengan jauh lebih jimat minyak dan kos operasi. Itulah teras prinsip 智能路由-gunakan enjin pemprosesan yang tepat untuk tugas yang tepat.
Di AINNA, melalui NeuralOps, 独立系统 构建者 代理 kami menggunakan LLM tempatan, Guard Rails, dan 智能路由 untuk mereka dan membina sistem. Penggunaan token mungkin tinggi semasa fasa pembelajaran awal, pembangunan, pengujian, dan pengesahan-tetapi ia bersifat sementara sahaja.
Apabila 独立系统 siap sepenuhnya, operasi berulang akan dipindahkan kepada peraturan tetap, perkhidmatan PHP, skrip automasi, pangkalan data, dan aliran kerja yang telah disahkan. 系统 itu kemudiannya boleh berjalan berterusan tanpa memerlukan LLM untuk memproses setiap transaksi.
Hasilnya, penggunaan token bulanan boleh jatuh dari kira-kira 32 bilion token kepada hanya 1.5–2 bilion token, kebanyakannya untuk kes-kes pengecualian, situasi tidak dikenali, penambahbaikan sistem, dan tugas yang benar-benar memerlukan AI. Dalam sesetengah kegunaan, aliran kerja teras 独立系统 itu sendiri mungkin hanya memerlukan kos operasi sekitar USD20 sebulan, bergantung kepada infrastruktur dan beban kerja.
Apa yang kita boleh capai bersama:
Pengurangan penggunaan token
Penjimatan kos operasi jangka panjang
Penggunaan LLM tempatan untuk kawalan lebih baik
Guard Rails bagi output yang lebih boleh diramal
智能路由 untuk mengelakkan model yang terlalu besar
AI digunakan hanya apabila benar-benar diperlukan
Aliran kerja 分离式 yang terus beroperasi tanpa caj token berulang
Prinsip yang kami bawa bersama NeuralOps amat mudah:
Jangan gunakan lori kalau Kancil sudah cukup untuk siapkan kerja itu. AI membina sistem. Kemudian, sistem itu berjalan sendiri.


