SB Intuitions TECH BLOG

フィード

記事のアイキャッチ画像
Sarashina3 translate: 翻訳品質を追求した日英・英日翻訳モデル
SB Intuitions TECH BLOG
こんにちは。SB Intuitions で機械翻訳モデルの開発を担当している 松野 智紀 です。 本記事では、日英・英日翻訳に特化した大規模言語モデル Sarashina3 translate の特徴について紹介し、他社の翻訳サービス・モデルとの比較評価実験の結果を報告します。 モデルの特徴 Sarashina3 translate は広い知識に裏打ちされた適切な語彙選択や日本語の特徴をとらえた翻訳テクニックにより、正確かつ読みやすい翻訳を実現しています。 その特長が表れる翻訳例をご紹介します。 以下はゲーム分野の文章の一部です。(WMT2024 1 翻訳タスク英日テストデータから抜粋) 入力…
7日前
記事のアイキャッチ画像
Sarashina3 rerank: 日本語検索に指示付きリランキングを導入する
SB Intuitions TECH BLOG
こんにちは、自然言語処理チームの李聖哲です。 本記事では、新たにAPI提供を開始する Sarashina3 rerank についてご紹介します。 Sarashina3 rerankは、ベクトル検索やキーワード検索で取得した候補文書を、クエリとの関連度に基づいて並べ替えるリランキングモデルです。検索システムやRAGにおいて、ユーザーに提示する文書やLLMに渡す文書を選び直す後段処理としての活用を想定しています。 TL;DR Sarashina3 rerankは、検索で取得した候補文書をクエリとの関連度に基づいてリランキングするモデルです。検索システムやRAGの後段で、ユーザーやLLMに渡す候補文…
18日前
記事のアイキャッチ画像
Sarashina3 embedding: 日本語に強い最新のテキスト埋め込みモデル
SB Intuitions TECH BLOG
こんにちは、自然言語処理チームの小川です。 本記事では、新たにAPI提供が開始されるSarashina3 embeddingについてご紹介します。まずはモデルの特徴と性能をご紹介し、続いて学習戦略の詳細や具体的な活用事例を通じて、その魅力をお伝えできればと思います。 TL;DR 日本語に強い指示認識型テキスト埋め込みモデル — 本モデルは 7 つのタスクタイプに対応 柔軟なベクトル次元削減 — Matryoshka Representation Learning(MRL)1 により、リソース制約に応じた運用が可能 日本語のテキスト埋め込みベンチマークで高性能 — JMTEB2 のスコアで主要モ…
19日前
記事のアイキャッチ画像
Sarashina3 guard: 日本語特化ガードレールモデル
SB Intuitions TECH BLOG
注意: 本記事はAIのガードレール機能を解説する目的のため、事例として一部に有害な表現や不適切なワードが含まれています。あらかじめご了承の上、閲覧いただきますようお願いいたします。 Responsible AIチームのPride Kavumba、Huy H. Hgnuyen、綿岡晃輝です。 本記事では、日本語に特化したガードレールモデルSarashina3 guardについてご紹介します。 ガードレールモデルとは? ガードレールモデルの概念図 ガードレールモデルとは、ユーザーの入力(プロンプト)や大規模言語モデル(LLM)の出力(レスポンス)に含まれる有害なコンテンツを検出し、安全性を担保する…
20日前
記事のアイキャッチ画像
Sarashina3 mini / Sarashina3 nano: フルスクラッチで開発した最新の国産LLM
SB Intuitions TECH BLOG
はじめに こんにちは、SB IntuitionsのYuyang Dong、廣淵亮太、平子潤です。 SB Intuitionsでは、日本語に強い国産のLLMの開発に取り組んでおり、これまでに様々なモデルの公開を進めてまいりました。また、開発したモデルをより幅広いビジネスシーン等でご活用いただくため、2025年11月からはSarashina2 miniを商用APIとして公開・提供しています*1。 この度、私たちは新たに開発した国産LLMであるSarashina3 miniおよび軽量化版であるSarashina3 nanoを公開します。これらのモデルはフルスクラッチで開発されており、新たな学習パイプ…
21日前
記事のアイキャッチ画像
日本語エージェントベンチマーク「J-tau telecom」の公開
SB Intuitions TECH BLOG
はじめに こんにちは、SB Intuitions株式会社でインターンをしている矢野千紘です。 近年、LLMの応用領域は多岐にわたっており、中でも自律的にタスクを遂行するエージェントは、特に大きな注目を集めている領域の一つです。しかし先行研究[Hofman et al., 2025]では、エージェント能力のベンチマークは評価言語に依存してスコアが変動することが報告されています。このことから、高性能な日本語LLMの開発においては、日本語エージェント能力の評価ベンチマークが不可欠です。 本ブログでは、広く利用されているエージェントベンチマークtau-benchのtelecomドメインを対象に、その日…
1ヶ月前
記事のアイキャッチ画像
Sarashina2.2-OCRデモアプリケーション展示報告(JSAI2026)
SB Intuitions TECH BLOG
こんにちは、SB Intuitions株式会社の髙田拓実です。 2026年6月8日(月)〜12日(金)の期間に群馬県高崎市のGメッセ群馬で開催された第40回人工知能学会全国大会(JSAI2026)にて、SB Intuitionsはプラチナスポンサーとしてブース出展を行いました。 ブースでは弊社が開発を進めるSarashinaシリーズのモデルを用いたデモアプリケーションを展示しました。 本記事では、展示したデモのうちの一つ「Sarashina2.2-OCRデモ」をご紹介します。 デモの様子 JSAIでは以下のデモを展示しました。 ブース出展中の #JSAI2026 では、文書画像の解析に特化した…
1ヶ月前
記事のアイキャッチ画像
学習率減衰なしの事前学習LLMにより、下流タスクで高い性能(ICLR 2026)
SB Intuitions TECH BLOG
機械学習のトップカンファレンスである International Conference on Learning Representations (ICLR) 2026において、以下の論文が採択されました。 Pre-training LLM without Learning Rate Decay Enhances Supervised Fine-tuning Kazuki Yano, Shun Kiyono, Sosuke Kobayashi, Sho Takase, Jun Suzuki 論文:https://openreview.net/forum?id=JnebU2QLdH 背景と問題意識…
3ヶ月前
記事のアイキャッチ画像
DEIM2026参加報告
SB Intuitions TECH BLOG
2月28日〜3月5日に兵庫県神戸市で開催された DEIM2026 に当社はゴールドスポンサーとして協賛いたしました。ブース展示・技術報告・口頭発表・ポスター発表を行いました。本記事では発表の様子や気になった論文について紹介しています。
4ヶ月前
記事のアイキャッチ画像
Sarashina2.2-Vision-3B: コンパクトかつ性能が高いVLMの公開
SB Intuitions TECH BLOG
概要 SB Intuitionsでは、大規模視覚言語モデル(Vision-Language Model; VLM)の開発に取り組んでおり、これまでに公開時点で日本語ベンチマークにおいて国内最高性能であったSarashina2-Visionシリーズを公開しています。 この度、アカデミアや産業界におけるVLMの研究開発にさらに貢献することを目的として、弊社のコンパクトかつ高性能な日本語大規模言語モデルであるSarashina2.2-3B-Instructをベースに開発したVLMであるSarashina2.2-Vision-3BをMITライセンスのもとで公開します。このモデルは同サイズ帯では日本語ベ…
8ヶ月前
記事のアイキャッチ画像
WildGuardTestJP: 日本語ガードレールベンチマークの開発
SB Intuitions TECH BLOG
1. はじめに Responsible AIチームのRyo Bertolissi、Pride Kavumba、Huy Nguyen、綿岡晃輝です。 大規模言語モデル(LLM)が急速に進化する中で、その出力の安全性を確保するガードレールシステムの重要性が高まっています。しかし、この分野の研究やリソースの大半は英語でしか存在しておらず、日本語の高性能なガードレールシステムを開発するための環境はまだ十分に整っていません。 最近、英語圏ではWildGuardTestというガードレールを評価する安全性ベンチマークが登場しました [1]。これは、入力(プロンプト)と出力(応答)の有害性、さらにモデルが回答…
10ヶ月前
記事のアイキャッチ画像
『JamC-QA』: 日本の文化や風習に特化した質問応答ベンチマークの構築・公開(後編)
SB Intuitions TECH BLOG
こんにちは。 SB Intuitions で LLM の評価を担当している 岡 照晃、柴田 知秀 です。 本記事では我々が構築・公開した日本語のベンチマーク『JamC-QA(Japanese Multiple Choice QA, ジャムシーキューエー)』[岡+, 25]を前後編に分けて紹介しています。 前編 では JamC-QA 構築の背景、構築方法やどういった問題が含まれるのか紹介しました。 後編では JamC-QA を使った事前学習モデルの性能比較評価とその結果の考察を行なっていきます。 事前学習モデルの評価方法はこちらのブログ記事で詳しく紹介していますので併せてご覧ください。 性能評価…
10ヶ月前
記事のアイキャッチ画像
『JamC-QA』: 日本の文化や風習に特化した質問応答ベンチマークの構築・公開(前編)
SB Intuitions TECH BLOG
こんにちは。SB Intuitions で LLM の評価を担当している 岡 照晃、柴田 知秀 です。 本記事では我々が構築・公開した日本語のベンチマーク『JamC-QA(Japanese Multiple Choice QA, ジャムシーキューエー)』[岡+, 25]を紹介します。 JamC-QA は日本固有の知識(e.g., 日本の文化、風習、...)を問う質問応答ベンチマークです。 問題形式は JCommonsenseQA [栗原+, 23] や JMMLU といった既存のベンチマークと同じ多肢選択式ですが、 難度はそれらより高く、 下記の評価結果を見ても、JamC-QA ではスコアが一…
10ヶ月前
記事のアイキャッチ画像
Sarashina-Embedding-v2-1B: 日本語に特化した指示を付与できるテキスト埋め込みモデル
SB Intuitions TECH BLOG
TL;DR sarashina2.2-1Bをベースに対照学習したテキスト埋め込みモデルを構築 クエリに対して指示文で付与することで、タスク毎にテキストベクトルを調整可能 JMTEBベンチマークで最高水準のスコアを達成(2025年7月28日時点) 特にRetrieval、STS、Rerankingタスクでハイスコア 公開ページ: https://huggingface.co/sbintuitions/sarashina-embedding-v2-1b 図1: JMTEBを用いた既存モデルとSarashina-Embedding-v2-1Bの性能比較 概要 こんにちは、SB Intuitions株…
1年前
記事のアイキャッチ画像
ICML 2025に論文が採択されました
SB Intuitions TECH BLOG
機械学習のトップカンファレンスである International Conference on Machine Learning (ICML) 2025において、以下の論文が採択されました。 Scaling Laws for Upcycling Mixture-of-Experts Language Models Seng Pei Liew, Takuya Kato, Sho Takase 論文:https://openreview.net/forum?id=ZBBo19jldX コード:https://github.com/sbintuitions/sparse-upcycling-scali…
1年前
記事のアイキャッチ画像
日本語ModernBERTの開発: トークナイザと性能の関係編 (3/3)
SB Intuitions TECH BLOG
概要 こんにちは、SB Intuitions株式会社インターンの塚越です。 先日、日本語・英語合わせて約4.4T tokensを学習した日本語ModernBERTというモデルを構築・公開しました。 公開したモデルがどんなモデル、どんな性能なのかについては日本語ModernBERTの開発: 開発と評価編 (1/3)を、開発過程で加えた工夫や分析については日本語ModernBERTの開発: 分析編 (2/3)をご覧ください。 さて、日本語自然言語処理をする上で、トークナイザや分かち書き器をどう扱うかは、多くの方が頭を悩ませたことがある話題だと思います。 本記事では、これらが日本語ModernBER…
1年前
記事のアイキャッチ画像
日本語ModernBERTの開発: 分析編 (2/3)
SB Intuitions TECH BLOG
概要 こんにちは、SB Intuitions株式会社インターンの塚越です。 先日、日本語・英語合わせて約4.4T tokensを学習した日本語ModernBERTというモデルを構築・公開しました。 公開したモデルがどんなモデル、どんな性能なのかについては日本語ModernBERTの開発: 開発と評価編 (1/3)をご覧ください。 本記事では、日本語ModernBERTの開発において実施した性能向上のための取り組みや、小規模言語モデル(Small Language Model: SLM)との性能比較、分析結果についてお話しします。 性能向上のための取り組みと分析 我々が開発した日本語Modern…
1年前
記事のアイキャッチ画像
日本語ModernBERTの開発: 開発と評価編 (1/3)
SB Intuitions TECH BLOG
概要 こんにちは、SB Intuitions株式会社インターンの塚越です。 日本語・英語合わせて約4.4T tokensを学習した日本語ModernBERTというモデルを構築・公開しました。 本記事では、その開発過程や評価結果についてお話しします。 我々が開発した日本語ModernBERTは、30m, 70m, 130m, 310mと4つの異なるパラメータサイズをもち、それぞれのモデルが同パラメータ規模のモデルと比較して、本記事公開時点では最も高い性能を達成しています。 開発した一連のモデルはHuggingFaceにてMITライセンスのもと公開しておりますので、商用・研究用問わず自由にお使いい…
1年前
記事のアイキャッチ画像
COLING2025の参加報告
SB Intuitions TECH BLOG
こんにちは、SB Intuitions株式会社の高山隼矢, 大萩雅也です。1月19-24日にアラブ首長国連邦(UAE)のアブダビで開催された、自然言語処理における代表的な国際会議の一つであるCOLING 2025にて発表を行いました。 本記事ではCOLINGに参加して感じたことや気になった論文について紹介いたします。 COLING 2025の概要 COLING (International Conference on Computational Linguistics) は、自然言語処理および計算言語学に関する国際会議であり、幅広い言語処理技術とその応用に関する研究が発表される場です。今年のC…
1年前
記事のアイキャッチ画像
日本語 LLM の安全性境界テスト
SB Intuitions TECH BLOG
R&D 本部 Responsible AI チームの黒澤です。Responsible AI チームでは、チーム名にある通り「責任のある AI」を目指し、特に大規模言語モデル (LLM) の倫理観や安全性を向上させるための取り組みを行なっています。 本記事では、言語処理学会第31回年次大会 (NLP2025) で発表した「大規模言語モデルのための日本語安全性境界テスト」について紹介します。 予稿は学会ホームページで閲覧することができますが、こちらでは予稿に載せきれなかった日本語安全性境界テストの特徴や、予稿提出後にリリースされた新しい LLM を対象に、本データセットによる評価結果について議論を…
1年前
記事のアイキャッチ画像
Sarashina2-Vision-8B, 14Bの性能評価
SB Intuitions TECH BLOG
概要 SB Intuitionsでは、日本語や日本の文化・慣習に強い大規模視覚言語モデル(Vision-Language Model; VLM)の開発を進めており、2025年3月にオープンな日本語向けVLMであるSarashina2-Vision-8B, 14Bをリリースしました。 本記事ではVLM評価チームが行ったSarashina2-Vision-8B, 14Bの性能評価について解説します。 Sarashina2-Visionのモデル構成および学習の詳細については別記事をご参照ください。 本記事におけるSarashina2-Visionの性能評価では、以下の観点で評価を行いました。 日本語…
1年前
記事のアイキャッチ画像
Sarashina2-Vision: 日本語特化の大規模視覚言語モデルの公開
SB Intuitions TECH BLOG
概要 SB Intuitionsでは、日本語や日本の文化・慣習に強い大規模視覚言語モデル(Vision-Language Model; VLM)の開発を進めており、2025年3月に弊社の日本語大規模言語モデル(Large Language Model; LLM)のSarashina2をベースに開発したVLMであるSarashina2-Vision (8B・14B)を公開しました。 Sarashina2-Visionは、日本に関連する画像に基づいた専門的タスクの処理能力を測るベンチマークや日本語の複雑図表の理解能力を測る内製ベンチマークなど、複数の日本語ベンチマークにおいて国内最高の性能を実現し…
1年前
記事のアイキャッチ画像
バックトラッキングを活用したマルチエージェントシステムによる複数制約充足プランニング
SB Intuitions TECH BLOG
はじめに こんにちは、東北大学修士2年の守屋彰二と申します。この度、SB Intuitions株式会社 R&D本部 Foundation dev部 Dialogチームにて、インターンシップに参加させていただきました。 本記事では、インターン中に取り組んだ「マルチエージェントによる複数制約充足プランニング」について、その概要と成果を紹介いたします。 大規模言語モデル(LLM)の登場により、さまざまな分野でその可能性が注目されています。その一例として、プランニングタスクにおける活用があります。プランニングタスクとは、与えられた目標を達成するための一連の計画を策定するタスク [Huang+,24] …
1年前
記事のアイキャッチ画像
Sarashina2.2-Instruct:コンパクトかつ性能の高い日本語Instructモデル
SB Intuitions TECH BLOG
概要 Tuningチームの清野舜、小林滉河、馬越雅人、入亮介です。 SB Intuitionsでは日本語に特化した大規模言語モデル(Large Language Model; LLM)の開発に取り組んでおり、これまでにSarashina1、Sarashina2シリーズや国内最大規模のMoEモデルを公開しています。 また、本記事に先立って、Sarashina2を更にブラッシュアップした事前学習済みモデルを公開しました。 この度、アカデミアや産業界におけるLLMの研究開発に更に貢献することを目的として、事後学習1を行った0.5B、1B、3Bモデル(Instructモデル)をMITライセンスのもとで…
1年前
記事のアイキャッチ画像
Sarashina2.2:数学・コーディングタスクの性能を向上させた日本語言語モデル
SB Intuitions TECH BLOG
概要 Pretrainingチームの高瀬翔と李凌寒です。 弊チームでは日本語能力に主眼を置いた大規模言語モデルの構築に取り組んでおり、Sarashina2-70BやSarashina2.1-1Bのように、いくつか事前学習モデルも公開してきました。 これまで公開したモデルは日本の知識を問う質問応答タスクでは高い性能を達成している一方で、数学タスクやコーディングタスク、すなわち、文章題のような自然言語で提示された計算問題や、与えられた指示を満たすコードを生成するタスクの性能は芳しくありませんでした。 これは、CommonCrawlのようなウェブ文書の中に、数学・コーディングタスクの性能向上に寄与す…
1年前
記事のアイキャッチ画像
Sarashina-Embedding-v1-1B: 日本語LLMをベースにしたテキスト埋め込み(2/2)~発展編~
SB Intuitions TECH BLOG
基本編はこちら→Sarashina-Embedding-v1-1B: 日本語LLMをベースにしたテキスト埋め込み(1/2)~基本編~ TL;DR 10億パラメータの日本語言語モデルであるSarashina2.1-1Bを事前学習モデルとした日本語テキスト埋め込みモデルを学習。 弱教師あり学習と教師あり学習の二段階の対照学習。 JMTEBベンチマークで最高水準のスコアを達成。特にRetrieval、Classification等でハイスコア。 弱教師あり学習と教師あり学習の二段階学習によってモデル性能が向上。 事前学習のトークン数を増やすと後段のテキスト埋め込みモデルの性能が向上。 弱教師あり学習…
1年前
記事のアイキャッチ画像
Sarashina-Embedding-v1-1B: 日本語LLMをベースにしたテキスト埋め込み(1/2)~基本編~
SB Intuitions TECH BLOG
TL;DR Sarashina-Embedding-v1-1Bという日本語特化テキスト埋め込みモデルを開発し、モデルを公開. 12億パラメータの日本語言語モデルであるSarashina2.1-1Bを事前学習モデルとした日本語テキスト埋め込みモデル。 コンテキスト長は8192トークンで、日本語特化モデルとしては最大。 JMTEBベンチマークで最高水準のスコアを達成。特にRetrieval、Classification等でハイスコア。 公開ページ: https://huggingface.co/sbintuitions/sarashina-embedding-v1-1b 図1: JMTEBベンチマ…
2年前
記事のアイキャッチ画像
Sarashina2-8x70Bの公開
SB Intuitions TECH BLOG
概要 SB IntuitionsのSeng Pei Liew、李凌寒、高瀬翔です。 弊社では日本語能力に主眼を置いた大規模言語モデルの構築に取り組んでおり、パラメータの大規模化のための施策として、学習済みの70Bパラメータ*1をMixture-of-Experts(MoE)モデルに拡張し、事前学習を行ったモデルをSarashina2-8x70Bとして公開しました。 言語モデルの100Bパラメータ以上までの大規模化はまだ弊社でも試行錯誤の段階にあり、引き続き大規模なモデルの学習を行っていますが、 本記事では先日公開したSarashina2-8x70Bの性能やMoE、学習済モデルのMoEモデルへの…
2年前
記事のアイキャッチ画像
LLMの盗用を守るフィンガープリンティング
SB Intuitions TECH BLOG
はじめに 東京科学大学情報理工学院 修士1年の山辺翔二郎と申します。2024年8月19日より、SB Intuitions株式会社 R&D本部 Responsible AIチームにてインターンシップを経験させていただきました。本記事では、インターンシップ中に取り組んだ研究テーマである「大規模言語モデルの知的財産保護のためのフィンガープリンティング手法」について、その概要と成果をご紹介いたします。 なお、本研究の詳細については、arXivにて論文を公開しております。 LLMの盗用防止の重要性 近年、大規模言語モデル(LLM)の開発には、膨大なデータセットと計算資源が必要となっています。その結果とし…
2年前
記事のアイキャッチ画像
SIGDIAL2024の参加報告
SB Intuitions TECH BLOG
こんにちは、SB Intuitions株式会社の高山隼矢, 大萩雅也, 山崎天, 泉健太, Liu Lianboです。9月18-20日に京都で開催された、対話システム・談話研究に関する代表的な国際会議であるSIGDIAL2024にゴールドスポンサーとして協賛・参加いたしました。 本記事ではSIGDIALに参加して感じたことや気になった論文について紹介いたします。 目次 目次 SIGDIAL2024の概要 参加記 気になった発表 最後に SIGDIAL2024の概要 SIGDIAL (Meeting of the Special Interest Group on Discourse and D…
2年前