測定 73件
タスク定義が変わる前に測った結果が 1件ある。投げた仕事が別物なので、この表には入れていない(下の実測には残してある)。
| シナリオ | モデル | 同時本数 | 測定日 | |
|---|---|---|---|---|
policy-lookup-ja | ornith-ai/Ornith-1.5-35B-A3B-GGUF | 1本 | 2026-08-30 | 測定を見る |
long-report-ja | ornith-1.5-35b-a3b | 1本 | 2026-08-28 | 測定を見る |
policy-lookup-ja | ornith-1.5-35b-a3b | 1本 | 2026-08-28 | 測定を見る |
contract-type-ja | ornith-1.5-35b-a3b | 1本 | 2026-08-28 | 測定を見る |
contract-terms-json-ja | ornith-1.5-35b-a3b | 1本 | 2026-08-28 | 測定を見る |
下は、応答時間は基準内で、正答率の95%区間が基準をまたいでいる構成。件数が足りず、満たしたとも割ったとも言えないので上の表には数えていない。
| シナリオ | モデル | 同時本数 | 測定日 | |
|---|---|---|---|---|
payslip-json-ja | ornith-1.5-35b-a3b | 1本 | 2026-08-30 | 測定を見る |
基準を満たしたものはまだありません。
README「表の読み方」・METHOD.md「測っている値」より
※ が付く行は、点推定では正答率が 基準を割っているものの、区間の上端が基準を超えていて断定できない行ですp95 は補間せず、実際に測れた値をそのまま使います。補間すると、測っていない値が表に出てしまうためです。